本文提出了 HBridge,这是一种统一的 H 型框架,通过非对称 MoT 架构集成了多模态理解与生成。 通过引入异构专家、中间层语义桥和语义重建 Token,HBridge 以较低的训练成本实现了卓越的性能
统一多模态理解与生成通常将自回归(视觉)语言模型(LLMs/VLMs)与基于扩散的视觉生成器相结合,其中 LLMs/VLMs 用于理解任务,而扩散生成器专注于视觉合成。 在这些方法中,BAGEL 和 LMFusion 采用的 Transformer 混合(MoT)范式 ,并在理解和生成任务上均取得了业内领先的结果。 该范式采用对称的密集连接设计:部署两个相同的专家模型,两者均由预训练的 LLM/VLM 初始化以进行理解和生成,并通过逐层的共享自注意力桥接多模态交互。
统一 MoT 范式仍面临两个根本性限制:
<aside> 💡

对称的 7B+7B 基线模型(橙色,由 Qwen2.5-VL-7B 初始化)收敛速度慢于我们的非对称 7B+4B 模型(绿色,其中 4B 生成专家由 OmniGen2 初始化)。 值得注意的是,即使是随机初始化的 7B+4B 模型(蓝色 H 型桥接的设计灵感来源于 (b) 和 (c) 中的相关性模式,这些模式衡量了在破坏 BAGEL 中各个专家间的交叉自注意力连接时,特征漂移和文本生成图像(T2I)性能的下降情况。 这些研究揭示了中间层连接主导了性能表现,而浅层和深层连接的贡献极小。 通过仅保留必要的中间层桥接,我们的架构不仅简化了融合过程,而且能够超越原始的稠密融合模型。 (d) 和 (e) 中相应的可视化示例进一步验证了上述观察结果。 请注意,(b)-(e) 中的结果直接来源于 BAGEL。
</aside>
网络架构
<aside> 💡

HBridge 架构如图所示。 我们将任意预训练的理解专家与预训练的生成专家配对,并通过自注意力机制连接它们的中间层。 在实践中,理解专家通常是一个 VLM,而生成专家通常是 DiT 的变体。 应用 QKV-Linear 模块来对齐它们的特征维度。 此外,我们引入了可学习的语义 Token,用于显式重构目标图像的视觉语义 Token,从而改进文本对齐并增强生成质量
</aside>
所提出的 HBridge 引入了三项关键创新:
(1) 异构专家,允许理解分支和生成分支采用更适合其各自模态的预训练架构。 其中,理解专家基于大型预训练 LLM 或视觉-语言模型初始化,生成专家基于面向扩散的 Transformer;
(2) 中间层语义桥,实现选择性的信息交换,仅有部分中间层通过交叉注意力桥进行连接,形成平衡独立性与交互性的 H 型拓扑结构
我们发现稠密连接的 MoT 架构可能会导致对浅层文本语义的潜在过拟合,从而绕过高层次的推理语义。 因为许多生成任务(例如生成物体)仅通过在训练过程中利用来自冻结理解专家的浅层词汇或实体特征即可获得令人满意的结果,这导致生成模型忽略了提取高层次的推理线索。 为了缓解这一问题,我们的 HBridge 引入了一个中间层语义桥,仅在选定的L中间层范围内连接这两个专家,并跳过前M层和最后N层的连接
(3) 用于生成中**显式语义基础(Semantic Grounding)**的语义重建 Token。