通过重复使用同一个 Transformer Block,在不增加参数量的情况下增加计算深度,使模型能够通过“想得更深”来处理训练时没有见过的复杂组合。
核心变化:
传统 Transformer
Input → Layer1 → Layer2 → ... → LayerN → Output
参数不同
Depth-Recurrent Transformer
Input → Block → Block → Block → ... → Block → Output
↑ ↑ ↑ ↑
同一组参数 θ 反复使用
传统 Transformer 的问题:
Model Depth≈Computation Depth
如果希望模型进行更多 computation,通常需要:
更多 Layer
↓
更多 Parameters
↓
更大的 Model
Depth-Recurrent Transformer 则把两者解耦:
$h_{t+1}=f_\theta(h_t)$
其中所有 step 都共享: θ
所以:
Parameter Count ≈ 固定
Computation Steps
↑ 可以增加
用参数复用换取更深的计算。
普通 Transformer: $h_{l+1}=f_{\theta_l}(h_l)$