by 史璇珂

一、 研究动机

<aside> 💡

语言预训练已接近天花板,视觉是下一个突破口——但多模态预训练的底层规律至今不清楚,本文通过从零开始的受控实验来填补这一空白

本文采用 Transfusion 框架,语言部分使用下一个 token 预测,视觉部分使用流匹配(flow matching),在包含文本、视频、图文对乃至动作条件视频的多样化数据上进行训练。模型采用解码器-only Transformer,并配备了模态专属 FFN(Modality-specific FFNs),相比共享 FFN,该设计在不增加推理成本的前提下同时提升了文本困惑度和视觉任务表现。

</aside>

二、 四大核心发现:

<aside> 💡

与主流观点不同——传统认为 VAE 用于生成、语义编码器用于理解——作者证明结合了 SigLIP 2 的表示自编码器(RAE,Representation Autoencoder)能同时在视觉理解和生成上表现出色,是统一多模态预训练的最优视觉表示方案

</aside>

<aside> 💡

视觉数据和语言数据具有互补性,能为下游能力带来协同增益。多模态联合训练不是零和博弈,而是正向促进——学视觉反过来帮助语言,反之亦然。

</aside>

<aside> 💡

统一多模态预训练自然地通向世界建模(World Modeling),相关能力从通用训练中自然涌现,无需专门设计。意味着模型在训练图文、视频后,可以自发习得对物理世界的隐式理解。

</aside>

<aside> 💡

通过 IsoFLOP 分析,作者计算了两种模态的 Scaling Law(扩展定律),发现了一个关键的扩展不对称性(scaling asymmetry):视觉比语言需要显著更多的数据

混合专家架构(MoE)通过提供语言所需的高模型容量同时适应视觉数据密集型的特性,自然诱导出模态专业化分工,从而协调这一不对称性,为真正统一的多模态模型铺平道路

</aside>

三、 实验设置:

(a)多模态预训练:训练与推理

🎯 实验设置总则

<aside> 💡

📐 训练目标

<aside> 💡

1. 语言建模损失(Language Modeling Loss)

$\mathcal{L}{LM} = -\sum{i=1}^{n} \log p_{\theta}(x_i \mid x_{<i})$


2. 视觉流匹配损失(Image Flow Matching Loss)

$\mathcal{L}{flow} = \mathbb{E}{t, z_0, \epsilon} \left[ \| v_{\theta}(z_t, t, \text{context}) - (z_0 - \epsilon) \|_2^2 \right]$

关键变量:

符号 含义
$z_0$ 图像/视频帧的干净潜变量
$\epsilon \sim \mathcal{N}(0, I)$ 高斯噪声
$t \sim \mathcal{U}[0, 1]$ 随机采样的时间步
$z_t = (1 - t)\epsilon + t z_0$ 插值后的带噪潜变量
$v_{\theta}$ 模型预测的速度场

实现细节:

3. 混合训练目标(Joint Loss)

$\mathcal{L} = \lambda_{LM} \cdot \mathcal{L}{LM} + \lambda{flow} \cdot \mathcal{L}_{flow}$

默认权重:

训练数据

<aside> 💡

每个 batch 包含来自以下多个来源的混合样本:

数据类型 说明
纯文本 Text-only
纯视频 Video-only
图文对 Image-text pairs
动作条件视频 Action-conditioned video
</aside>