Paper: SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

Authors: Shaowen Wang, Ge Zhang, Kairong Luo, Yuhao Wu, Shaofan Liu, Jiaheng Liu

Date: 2026-09-01

Topic: Looped Transformer / MoE / Scaling Law / Compute Efficiency / Parameter Sharing


1. TL;DR

image.png

核心结论:

在严格匹配 Per-token FLOPs、Non-embedding Parameters、KV Cache 三项预算的情况下,Looped MoE Transformer 仍然优于普通 Transformer。

image.png

作者最终提出:

SMELT = Sparse MoE Transformer + middle layers Loop Twice

即:

将 Transformer 中间 50% 的层重复执行一次,使中间层总共访问两次。

在最多 54B non-embedding parameters 的四个模型规模上进行 scaling law 实验,SMELT 的 compute-optimal frontier 可以节省约:

6.8% ~ 18.0% training FLOPs

同时: