核心一句话:统一多模态模型(UMMs)表面上共享参数,但内部视觉与语言的信息流完全分裂——这种"伪统一"是当前多模态模型的根本瓶颈。
设计目标:统一多模态模型(Unified Multimodal Models, UMMs)试图在同一个模型中融合两种能力:
现实问题:这种融合在实践中并没有真正发生。UMMs 无法将推理能力迁移到图像生成,文本输出和图像输出行为截然不同。论文将这一现象命名为:
伪统一(Pseudo-Unification):共享了参数,但没有实现真正的跨模态协同。
已有方法的局限:现有探测方法要么缺乏模型内部视角,要么忽略 prompt 与 response 之间的依赖关系,无法准确诊断根本原因。
论文提出用信息论工具从模型内部分析"统一程度"。
| 指标 | 含义 | 分析维度 |
|---|---|---|
| 熵(Entropy) | 表征编码输入时的不确定性/信息量 | 揭示编码模式 |
| 条件熵(Conditional Entropy) | 给定输入后,输出的不确定性 | 揭示响应模式 |
在 10 个代表性 UMM 上系统验证,包括 BAGEL-14B、Harmon-1.5B 等。
<aside>

基于信息论的 UMM 探测。
左图:从基于 Transformer 的 UMM 中提取提示、响应及隐状态嵌入序列,并计算熵(用于衡量编码模式的表征质量)和条件熵(用于衡量在给定输入条件下响应模式的输出不确定性)。右上图:基于矩阵的熵随独立信息簇数量的增加而增大。右下图:随着两个嵌入序列之间依赖性的减弱,条件熵随之升高。
</aside>