核心一句话:LLaVA 的语言模型内部有一套自发形成的机制来处理视觉信息——局部定位 → 逐层"翻译"为词汇表征 → last token 汇聚提取——但这套机制的效率远不够用。
<aside>

在适配器风格的视觉-语言模型(VLM)中,视觉标记(绿色所示)充当了语言模型(LM)的“软提示”,且无法通过词汇嵌入进行语义解读。通过一系列物体识别任务,我们发现:
(1) 物体信息可被定位至视觉token的一个子集;
(2) 视觉Token的表征正逐渐演化为具有可解释性的文本嵌入;
(3) 在模型的中后期层级中,模型会将部分信息从视觉标记中提取并汇聚至最后一个标记的位置,从而实现对物体的识别。
</aside>
图像 → CLIP ViT → MLP Adapter → visual tokens → [ LM ] → 文本输出
text tokens ↗
LLaVA 中,LM 占整个模型参数的 95% 以上。视觉信息能否被有效利用,关键在 LM。
Visual token 是 CLIP 特征经过 MLP adapter 投影后的软提示(soft prompts),它们在词表空间里没有任何语义对应——进入 LM 时本质上是一堆乱码。那 LM 是怎么从这些乱码里读出图像内容的?这是论文想解开的谜题。
| 假说 | 内容 |
|---|---|
| 空间局部化 | 物体信息集中在对应物体位置的 token 上 |
| 全局分散 | 主要依赖 register token 等全局特征 |
| 工具 | 原理 | 回答的问题 |
|---|---|---|
| Token ablation(消融) | 屏蔽特定位置的 visual token,观察性能变化 | 信息在哪里? |
| Logit Lens(扩展版) | 把中间层 hidden state 投影到词表空间 | 表征如何演化? |
| Attention Knockout(注意力阻断) | 切断特定 token 对 final token 的 attention | LM 何时提取信息? |
实验:屏蔽对应物体空间位置的 visual token(含 1 个 buffer token),观察 VQA 性能。
结果: