1. TL;DR

作者提出 Recurrent Transformer:

让每一个 Transformer Layer 都维护自己的 Recurrent Memory,使 Layer 可以跨 Token 持续更新和读取自己的历史表示。

这样做带来两个核心效果:

核心思想可以浓缩成:

不要只通过堆更多 Layers 增加 Depth,而是让每个 Layer 自己进行 Recurrence。


2. 论文到底改了什么?

最核心的改变只有一句话:

每个 Layer 都拥有一个 Layer-specific Recurrent Memory。

这个 Memory 本质上就是:

当前 Layer 已经处理过的历史 Token 的表示。

因此当前 Layer 在处理新的 Token 时,可以访问:

当前 Layer 已经处理过的历史 Token
                ↓
        Recurrent Memory
                ↓
          当前 Token

3. 核心机制:Layerwise Recurrence

假设现在处理一串 Token:

Token 1
Token 2
Token 3
Token 4