Paper: SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers
Authors: Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu, Jiaheng Liu
Date: 2026-09-01
Topic: Looped Transformer / MoE / Scaling Law / Compute Efficiency / Parameter Sharing

核心结论:
在严格匹配 Per-token FLOPs、Non-embedding Parameters、KV Cache 三项预算的情况下,Looped MoE Transformer 仍然优于普通 Transformer。

作者最终提出:
SMELT = Sparse MoE Transformer + middle layers Loop Twice
即:
将 Transformer 中间 50% 的层重复执行一次,使中间层总共访问两次。
在最多 54B non-embedding parameters 的四个模型规模上进行 scaling law 实验,SMELT 的 compute-optimal frontier 可以节省约:
6.8% ~ 18.0% training FLOPs
同时: