一些启发的现象:
Pseudo-Unification 发现,text prompt 和image prompt 在umm的逐层熵状态存在差异。text prompt在浅层会出现突然的它所,然后回升。image prompt一致保持在高位。猜测语言具备高度语义话的embedding,浅层可以迅速整合信息,图像逐patch编码,空间分散。更难整合语义。 T2I任务的条件熵始终低于对话任务,因为文生图偏向intruction following,而语言模型偏向创造新token
AIA逐层分析了文本和图像token在理解任务和生成任务的交互程度。发现两者几乎完全是负相关的。 生成任务从浅层到深层逐渐下降。理解任务从浅层到深层逐渐提高。UMM模型从完全共用参数到逐渐解耦比如基于MoT的Bagel,或者更松散的两阶段的OmniGen2. 核心不是架构的解耦。作者发现attention交互模式随着架构解耦的过程,越来越倾向于独立模型(Qwen2.6VL + HunyuanImage)。 因此在UMM的理解和生成任务的在层间attention的变化模式与独立模型一致,也可以不做架构解耦,达到相同的效果
AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model