<aside>

image.png

不同 UMM 架构在各层的跨模态注意力中,生成与理解始终呈现负相关关系;随着架构解耦程度增加,这种模式逐渐逼近单任务模型(生成类似 HunyuanImage,理解类似 Qwen3-VL),从而带来性能提升,但并未消除任务冲突。

</aside>

一 背景:

<aside>

二 关键发现—-解耦为什么有效?

<aside>


任务冲突不会消失,而是表现为 attention 竞争;解耦的作用是让模型学习更接近单任务的注意力分配因此提出,用显式约束(AIA)直接学习这种“单任务注意力模式”

</aside>

三 注意力交互对齐损失(AIA)

<aside>

🎯 核心思想

AIA 通过对齐“分层 attention pattern”,在不改变架构的前提下,让统一模型学习单任务行为,从而缓解任务冲突并提升性能。

1️⃣ 目标定义

2️⃣ AIA Loss

$\mathcal{L}_{AIA} =\frac{1}{L} \sum{l=1}^{L}\begin{cases}\frac{1}{2}(I_l - T_l)^2 & |I_l - T_l| \le \delta_l \\delta_l |I_l - T_l| - \frac{1}{2}\delta_l^2 & \text{otherwise}\end{cases}$


3️⃣ 设计要点

4️⃣ 与原损失结合

$\mathcal{L} = \mathcal{L}{NTP} + \lambda \mathcal{L}{AIA}$ 默认:λ = 40

</aside>

实验结果

<aside>

模型 解耦程度 使用阶段
Emu3 完全统一 SFT
Janus-Pro 部分解耦 Post-training

<aside>

🧠 核心思想

统一多模态模型的性能瓶颈不在于架构是否解耦,而在于其是否学到了正确的跨模态注意力模式。

AIA 通过对齐 attention pattern(而非结构或输出),在保持统一性的同时实现了接近解耦模型的性能。

👉 性能提升不是因为“解耦”,而是因为“学到了更像单任务的注意力模式”

👉 所以直接与单任务模型对齐注意力模式(AIA loss),就能不用解耦也提升性能