<aside>
参考博客:
https://mp.weixin.qq.com/s/Ynt7xQTg5wWAf64Szup4Gg
https://lh-zhu.github.io/The-Second-Half-of-Model-Architecture/
</aside>
<aside>
过去十年,大模型的发展路径其实非常统一:不断扩展模型规模、训练数据和上下文长度。尤其是在 sequence 维度,整个行业投入了大量精力优化 token 之间的信息流动,例如 sparse attention、linear attention、FlashAttention、RoPE scaling 等机制。这些工作本质上都在解决一个问题:
如何让 token 与 token 更高效地通信?
而这些投入也确实带来了巨大回报,包括:
这一阶段的成功,本质上来源于整个领域认真优化了 sequence 维度上的“通信机制”。
但与此同时,另一个维度却几乎没有被真正扩展:
Layer ↔ Layer Communication
虽然 Transformer 已经从十几层扩展到了上百层,但层间通信机制却仍然停留在:
x + F(x)
即 ResNet 在 2015 年提出的 residual connection。
文章观点:
现代深度网络真正的瓶颈,不是计算能力,而是通信能力。
</aside>
Residual connection 最大的贡献,是解决了深层网络训练困难的问题。没有 residual 时,每一层只能看到上一层输出,信息和梯度都会逐层衰减。而 residual 通过:
$h_l = h_{l-1} + F(h_{l-1})$
让历史信息始终保留在 residual stream 中,这个机制虽然解决了“信息丢失”,却没有解决“信息访问”的问题。随着网络越来越深,residual stream 会变成:
x + F1(x) + F2(x) + F3(x) + ...
所有层的信息被不断累加到同一个通道中。作者用“传话游戏”来解释这个问题:第3层的信息虽然理论上还存在,但到第152层时,已经被151层新增信息淹没。信息没有消失,但已经很难被精准检索。
作者将这个现象称为:Information Dilution(信息稀释)
**Information preserved** ≠ **Information retrievable**
最终会导致一个重要后果:很多深层为了避免污染 residual stream,会倾向于输出极小更新。于是模型虽然 nominal depth 很深,但 effective depth 实际很浅。
作者认为,过去几乎所有改进 residual 的工作,本质上都停留在:
如何更好地“混合”各层信息
而不是:
如何“检索”真正需要的信息
例如 DenseNet 保留所有层输出,本质仍然是信息累加,只不过从加法变成 concat,但代价是 O(N²) memory。DenseFormer、LIMe 等方法引入学习到的 mixing weight: