核心一句话:统一多模态模型(UMMs)表面上共享参数,但内部视觉与语言的信息流完全分裂——这种"伪统一"是当前多模态模型的根本瓶颈。



🧩 背景:什么是 UMMs,问题在哪里?

设计目标:统一多模态模型(Unified Multimodal Models, UMMs)试图在同一个模型中融合两种能力:

现实问题:这种融合在实践中并没有真正发生。UMMs 无法将推理能力迁移到图像生成,文本输出和图像输出行为截然不同。论文将这一现象命名为:

伪统一(Pseudo-Unification):共享了参数,但没有实现真正的跨模态协同。

已有方法的局限:现有探测方法要么缺乏模型内部视角,要么忽略 prompt 与 response 之间的依赖关系,无法准确诊断根本原因。


🔬 方法:信息论探测框架

论文提出用信息论工具从模型内部分析"统一程度"。

两个核心指标

指标 含义 分析维度
熵(Entropy) 表征编码输入时的不确定性/信息量 揭示编码模式
条件熵(Conditional Entropy) 给定输入后,输出的不确定性 揭示响应模式

实验规模

在 10 个代表性 UMM 上系统验证,包括 BAGEL-14B、Harmon-1.5B 等。


指标示意及合理性证明:

<aside>

image.png

基于信息论的 UMM 探测。

左图:从基于 Transformer 的 UMM 中提取提示、响应及隐状态嵌入序列,并计算熵(用于衡量编码模式的表征质量)和条件熵(用于衡量在给定输入条件下响应模式的输出不确定性)。右上图:基于矩阵的熵随独立信息簇数量的增加而增大。右下图:随着两个嵌入序列之间依赖性的减弱,条件熵随之升高。

</aside>