共享自回归 (AR) Transformer 构建的统一多模态模型 (UMMs) 因其架构简洁性而备受青睐在多模态输入上进行训练时,模态共享的 Transformer 在视觉和文本之间会遭遇严重的梯度冲突,尤其是在浅层和深层中, 在表征变得更加抽象和语义更加对齐的中间层,这种冲突会减弱。
为了克服这一挑战,作者提出了 Uni-X,这是一种两端分离、中间共享的架构。Uni-X 将其初始层和最终层专门用于特定模态的处理,同时在中间层保持共享参数以实现高层语义融合。 这种 X 型设计不仅消除了两端的梯度冲突,还进一步缓解了共享层中的残余冲突
同的训练条件下,与强基线模型相比,Uni-X 实现了更优的训练效率。 当扩展至 3B 参数并使用更大的训练数据时,Uni-X 可以媲美甚至超过基于 7B 自回归(AR)的通用多模态模型(UMM),
视觉语言模型(VLM)通过将大语言模型(LLM)与强大的视觉编码器相结合,在多模态理解和推理方面取得了显著进展 。 受此启发,近期致力于增加图像生成功能的研究促成了**统一多模态模型(UMM)**的出现。
多先进的 UMM 依赖于日益复杂的系统设计来提升性能,包括增加语义图像编码器 、自回归和扩散范式的混合,或者引入任务特定的分支和专家模型。 虽然这些设计行之有效,但增加的复杂性阻碍了可扩展性,相比之下,**自回归(AR)通用多模态模型(UMMs)**提供了一种简单而强大的替代方案。 通过向量量化(VQ)将视觉输入视为一种“外语”,它们将文本和视觉统一为一致的 Token 序列,自然地扩展了以语言为中心的大语言模型(LLM)范式。 但是在多模态输入上联合训练的完全模态共享 Transformer 会表现出严重的梯度冲突。

如图所示, 模态共享 Transformer 中前馈网络(FFN)下down projection层的梯度冲突分析。 共享 Transformer 在浅层和深层表现出严重的冲突,仅在中间层得到部分缓解。 相比之下,Uni-X 避免了在两端的冲突,并进一步减轻了中间层的冲突; 由于文本和图像统计特征的差异,这些冲突在浅层(输入端)和深层(输出端)最为显著。 相反,中间层的表征变得愈发抽象和具有语义性,显示出较小的冲突和更强的跨模态对齐。
一个有效的 UMM 应当 尊重模态间的差异,而不是在所有层中强制执行统一的参数共享。
因此, 本文提出了 Uni-X,这是一种用于统一多模态建模的 两端分离、中间共享 架构。 在 Uni-X 中,浅层和深层是模态特定的,能够对文本和视觉中截然不同的低层分布进行专门处理,而中间层则通过共享来捕捉两者共有的高层语义抽象。 这种 X 型架构 不仅减轻了模型两端的严重梯度冲突,还通过利用模态间自然的语义对齐,进一步缓解了共享中间层的残余冲突。

梯度冲突示意图。 (a) 不同模态的损失函数空间呈现出截然不同的几何形状,在优化方向上产生潜在冲突。 (b) 损失总和的最优解与任何单一模态损失的最优解均不同。 (c) 在存在梯度冲突的情况下,优化轨迹会产生震荡,并导致收敛缓慢
(a)梯度分析:
如图2所示, 当不同的优化目标导致梯度指向不同方向时,就会发生梯度冲突,这会使得联合优化变得不稳定且低效。为了量化多模态训练中的梯度冲突,我们使用了**完全共享 Transformer 的早期的模型checkpoint,**使用超过 60 个小批量(mini-batch)且总计 200 万个 Token 的数据计算特定参数(FFN down-projection weights) 的平均梯度。