RAE进阶篇:
<aside> 💡
语言预训练已接近天花板,视觉是下一个突破口——但多模态预训练的底层规律至今不清楚,本文通过从零开始的受控实验来填补这一空白
为什么要超越语言? 语言本质上是对现实的有损压缩(柏拉图洞穴比喻),且高质量文本数据已近枯竭。视觉世界提供了无限的、更高保真的信号。
为什么现有研究不够? 当前多模态工作几乎都是在已有语言模型上"打补丁",语言预训练嵌入的先验知识污染了实验结论,根本无法分清哪些能力来自多模态训练本身。
本文怎么做?从零训练,控制变量,系统研究五个维度:视觉表示、数据配比、世界建模、架构设计、扩展规律

核心结论预告: RAE 是最优视觉表示;视觉与语言数据互补协同;世界建模能力自然涌现;MoE 能解决视觉比语言更"数据饥渴"的扩展不对称问题。
本文采用 Transfusion 框架,语言部分使用下一个 token 预测,视觉部分使用流匹配(flow matching),在包含文本、视频、图文对乃至动作条件视频的多样化数据上进行训练。模型采用解码器-only Transformer,并配备了模态专属 FFN(Modality-specific FFNs),相比共享 FFN,该设计在不增加推理成本的前提下同时提升了文本困惑度和视觉任务表现。
</aside>
<aside> 💡
与主流观点不同——传统认为 VAE 用于生成、语义编码器用于理解——作者证明结合了 SigLIP 2 的表示自编码器(RAE,Representation Autoencoder)能同时在视觉理解和生成上表现出色,是统一多模态预训练的最优视觉表示方案
</aside>
<aside> 💡
视觉数据和语言数据具有互补性,能为下游能力带来协同增益。多模态联合训练不是零和博弈,而是正向促进——学视觉反过来帮助语言,反之亦然。
</aside>
<aside> 💡
统一多模态预训练自然地通向世界建模(World Modeling),相关能力从通用训练中自然涌现,无需专门设计。意味着模型在训练图文、视频后,可以自发习得对物理世界的隐式理解。
</aside>
<aside> 💡
通过 IsoFLOP 分析,作者计算了两种模态的 Scaling Law(扩展定律),发现了一个关键的扩展不对称性(scaling asymmetry):视觉比语言需要显著更多的数据
混合专家架构(MoE)通过提供语言所需的高模型容量同时适应视觉数据密集型的特性,自然诱导出模态专业化分工,从而协调这一不对称性,为真正统一的多模态模型铺平道路
</aside>
<aside> 💡
<aside> 💡
$\mathcal{L}{LM} = -\sum{i=1}^{n} \log p_{\theta}(x_i \mid x_{<i})$
$\mathcal{L}{flow} = \mathbb{E}{t, z_0, \epsilon} \left[ \| v_{\theta}(z_t, t, \text{context}) - (z_0 - \epsilon) \|_2^2 \right]$
关键变量:
| 符号 | 含义 |
|---|---|
| $z_0$ | 图像/视频帧的干净潜变量 |
| $\epsilon \sim \mathcal{N}(0, I)$ | 高斯噪声 |
| $t \sim \mathcal{U}[0, 1]$ | 随机采样的时间步 |
| $z_t = (1 - t)\epsilon + t z_0$ | 插值后的带噪潜变量 |
| $v_{\theta}$ | 模型预测的速度场 |
实现细节:
$\mathcal{L} = \lambda_{LM} \cdot \mathcal{L}{LM} + \lambda{flow} \cdot \mathcal{L}_{flow}$
默认权重:
<aside> 💡
每个 batch 包含来自以下多个来源的混合样本:
| 数据类型 | 说明 |
|---|---|
| 纯文本 | Text-only |
| 纯视频 | Video-only |
| 图文对 | Image-text pairs |
| 动作条件视频 | Action-conditioned video |
| </aside> |