作者提出 Recurrent Transformer:
让每一个 Transformer Layer 都维护自己的 Recurrent Memory,使 Layer 可以跨 Token 持续更新和读取自己的历史表示。
这样做带来两个核心效果:
核心思想可以浓缩成:
不要只通过堆更多 Layers 增加 Depth,而是让每个 Layer 自己进行 Recurrence。
最核心的改变只有一句话:
每个 Layer 都拥有一个 Layer-specific Recurrent Memory。
这个 Memory 本质上就是:
当前 Layer 已经处理过的历史 Token 的表示。
因此当前 Layer 在处理新的 Token 时,可以访问:
当前 Layer 已经处理过的历史 Token
↓
Recurrent Memory
↓
当前 Token
假设现在处理一串 Token:
Token 1
Token 2
Token 3
Token 4