核心关键词: Recurrent Transformer / Implicit Reasoning / Recurrent Depth / Systematic Generalization / Depth Extrapolation / Grokking / Test-Time Compute
通过让同一组 Transformer Layers 循环执行多次,使模型能够在 Hidden State 中进行多轮隐式计算,从而提升组合泛化能力,并允许模型在推理阶段通过增加循环次数来处理比训练阶段更深的 Reasoning Chain。
核心思想:
把固定的 Network Depth 转化成可以在 Inference Time 动态增加的 Computation Depth。
传统 Transformer 的一个重要限制是:
模型的计算深度通常在架构设计阶段就被固定了。
例如一个 12-layer Transformer:
Input
↓
Layer 1
↓
Layer 2
↓
...
Layer 12
↓
Output
无论输入问题简单还是复杂,模型都按照固定的 12 层进行计算。
这会带来一个问题:
但是普通 Transformer:
无法很自然地根据问题难度增加内部计算次数。