核心一句话:LLaVA 的语言模型内部有一套自发形成的机制来处理视觉信息——局部定位 → 逐层"翻译"为词汇表征 → last token 汇聚提取——但这套机制的效率远不够用。


<aside>

image.png

在适配器风格的视觉-语言模型(VLM)中,视觉标记(绿色所示)充当了语言模型(LM)的“软提示”,且无法通过词汇嵌入进行语义解读。通过一系列物体识别任务,我们发现:

(1) 物体信息可被定位至视觉token的一个子集;

(2) 视觉Token的表征正逐渐演化为具有可解释性的文本嵌入;

(3) 在模型的中后期层级中,模型会将部分信息从视觉标记中提取并汇聚至最后一个标记的位置,从而实现对物体的识别。

</aside>


🧩 背景与问题

VLM 的标准架构

图像 → CLIP ViT → MLP Adapter → visual tokens → [ LM ] → 文本输出
                                  text tokens  ↗

LLaVA 中,LM 占整个模型参数的 95% 以上。视觉信息能否被有效利用,关键在 LM。

核心难点:visual token 是"乱码"

Visual token 是 CLIP 特征经过 MLP adapter 投影后的软提示(soft prompts),它们在词表空间里没有任何语义对应——进入 LM 时本质上是一堆乱码。那 LM 是怎么从这些乱码里读出图像内容的?这是论文想解开的谜题。

两个相互对立的假说

假说 内容
空间局部化 物体信息集中在对应物体位置的 token 上
全局分散 主要依赖 register token 等全局特征

🔬 三种探测工具

工具 原理 回答的问题
Token ablation(消融) 屏蔽特定位置的 visual token,观察性能变化 信息在哪里?
Logit Lens(扩展版) 把中间层 hidden state 投影到词表空间 表征如何演化?
Attention Knockout(注意力阻断) 切断特定 token 对 final token 的 attention LM 何时提取信息?

🔑 三大核心发现

发现 ① 物体信息高度空间局部化

实验:屏蔽对应物体空间位置的 visual token(含 1 个 buffer token),观察 VQA 性能。

结果: