1. 一句话理解

通过重复使用同一个 Transformer Block,在不增加参数量的情况下增加计算深度,使模型能够通过“想得更深”来处理训练时没有见过的复杂组合。

核心变化:

传统 Transformer
Input → Layer1 → Layer2 → ... → LayerN → Output
              参数不同

Depth-Recurrent Transformer
Input → Block → Block → Block → ... → Block → Output
          ↑       ↑       ↑              ↑
        同一组参数 θ 反复使用

2. 为什么需要 Depth Recurrence?

传统 Transformer 的问题:

Model Depth≈Computation Depth

如果希望模型进行更多 computation,通常需要:

更多 Layer
↓
更多 Parameters
↓
更大的 Model

Depth-Recurrent Transformer 则把两者解耦:

$h_{t+1}=f_\theta(h_t)$

其中所有 step 都共享: θ

所以:

Parameter Count ≈ 固定
Computation Steps
    ↑ 可以增加

核心思想

用参数复用换取更深的计算。


3. 什么是 Depth-Recurrent Transformer?

普通 Transformer: $h_{l+1}=f_{\theta_l}(h_l)$