<aside>

参考博客:

https://mp.weixin.qq.com/s/Ynt7xQTg5wWAf64Szup4Gg

https://lh-zhu.github.io/The-Second-Half-of-Model-Architecture/

</aside>

1. 过去十年,深度学习真正扩展的是什么?

<aside>

过去十年,大模型的发展路径其实非常统一:不断扩展模型规模、训练数据和上下文长度。尤其是在 sequence 维度,整个行业投入了大量精力优化 token 之间的信息流动,例如 sparse attention、linear attention、FlashAttention、RoPE scaling 等机制。这些工作本质上都在解决一个问题:

如何让 token 与 token 更高效地通信?

而这些投入也确实带来了巨大回报,包括:

这一阶段的成功,本质上来源于整个领域认真优化了 sequence 维度上的“通信机制”。

但与此同时,另一个维度却几乎没有被真正扩展:

Layer ↔ Layer Communication

虽然 Transformer 已经从十几层扩展到了上百层,但层间通信机制却仍然停留在:

x + F(x)

即 ResNet 在 2015 年提出的 residual connection。

文章观点:

现代深度网络真正的瓶颈,不是计算能力,而是通信能力。

</aside>


2. Residual Connection 的问题:Information Dilution

Residual connection 最大的贡献,是解决了深层网络训练困难的问题。没有 residual 时,每一层只能看到上一层输出,信息和梯度都会逐层衰减。而 residual 通过:

$h_l = h_{l-1} + F(h_{l-1})$

让历史信息始终保留在 residual stream 中,这个机制虽然解决了“信息丢失”,却没有解决“信息访问”的问题。随着网络越来越深,residual stream 会变成:

x + F1(x) + F2(x) + F3(x) + ...

所有层的信息被不断累加到同一个通道中。作者用“传话游戏”来解释这个问题:第3层的信息虽然理论上还存在,但到第152层时,已经被151层新增信息淹没。信息没有消失,但已经很难被精准检索。

作者将这个现象称为:Information Dilution(信息稀释)

**Information preserved** ≠ **Information retrievable**

最终会导致一个重要后果:很多深层为了避免污染 residual stream,会倾向于输出极小更新。于是模型虽然 nominal depth 很深,但 effective depth 实际很浅。


3. 过去的方法为什么没有真正解决问题?

作者认为,过去几乎所有改进 residual 的工作,本质上都停留在:

如何更好地“混合”各层信息

而不是:

如何“检索”真正需要的信息

例如 DenseNet 保留所有层输出,本质仍然是信息累加,只不过从加法变成 concat,但代价是 O(N²) memory。DenseFormer、LIMe 等方法引入学习到的 mixing weight: