核心关键词: Recurrent Transformer / Implicit Reasoning / Recurrent Depth / Systematic Generalization / Depth Extrapolation / Grokking / Test-Time Compute


1. 一句话总结

通过让同一组 Transformer Layers 循环执行多次,使模型能够在 Hidden State 中进行多轮隐式计算,从而提升组合泛化能力,并允许模型在推理阶段通过增加循环次数来处理比训练阶段更深的 Reasoning Chain。

核心思想:

把固定的 Network Depth 转化成可以在 Inference Time 动态增加的 Computation Depth。


2. 为什么要研究这个问题?

传统 Transformer 的一个重要限制是:

模型的计算深度通常在架构设计阶段就被固定了。

例如一个 12-layer Transformer:

Input
  ↓
Layer 1
  ↓
Layer 2
  ↓
...
Layer 12
  ↓
Output

无论输入问题简单还是复杂,模型都按照固定的 12 层进行计算。

这会带来一个问题:

简单问题 可能只需要很少的 computation。

复杂问题 可能需要进行很多轮 reasoning。

但是普通 Transformer:

无法很自然地根据问题难度增加内部计算次数。


3. 作者关注的两个 Generalization 问题