<aside>

不同 UMM 架构在各层的跨模态注意力中,生成与理解始终呈现负相关关系;随着架构解耦程度增加,这种模式逐渐逼近单任务模型(生成类似 HunyuanImage,理解类似 Qwen3-VL),从而带来性能提升,但并未消除任务冲突。
</aside>
<aside>
<aside>
任务冲突不会消失,而是表现为 attention 竞争;解耦的作用是让模型学习更接近单任务的注意力分配因此提出,用显式约束(AIA)直接学习这种“单任务注意力模式”
</aside>
<aside>
AIA 通过对齐“分层 attention pattern”,在不改变架构的前提下,让统一模型学习单任务行为,从而缓解任务冲突并提升性能。
$\mathcal{L}_{AIA} =\frac{1}{L} \sum{l=1}^{L}\begin{cases}\frac{1}{2}(I_l - T_l)^2 & |I_l - T_l| \le \delta_l \\delta_l |I_l - T_l| - \frac{1}{2}\delta_l^2 & \text{otherwise}\end{cases}$
$\mathcal{L} = \mathcal{L}{NTP} + \lambda \mathcal{L}{AIA}$ 默认:λ = 40
</aside>
<aside>
| 模型 | 解耦程度 | 使用阶段 |
|---|---|---|
| Emu3 | 完全统一 | SFT |
| Janus-Pro | 部分解耦 | Post-training |
<aside>
统一多模态模型的性能瓶颈不在于架构是否解耦,而在于其是否学到了正确的跨模态注意力模式。
AIA 通过对齐 attention pattern(而非结构或输出),在保持统一性的同时实现了接近解耦模型的性能。
👉 性能提升不是因为“解耦”,而是因为“学到了更像单任务的注意力模式”
👉 所以直接与单任务模型对齐注意力模式(AIA loss),就能不用解耦也提升性能