<aside>

论文核心:提出一套基于线性探针的分析框架,揭示多模态大语言模型(MLLM)内部各层的功能分工。

方法:在每层训练线性分类器,配合三类受控提示变体(词汇变体、语义否定、格式变体),逐层测试模型表示如何响应不同扰动。

核心发现:跨三个模型(LLaVA-1.5、LLaVA-Next-LLaMA-3、Qwen2-VL)发现一致的四阶段结构——视觉定位 → 词汇整合 → 语义推理 → 答案解码,其中阶段结构稳定,但各阶段占用层数随基础 LLM 架构而变化。

</aside>


🧩 1. Motivation(研究动机)

Multimodal LLM(MLLM)性能很强,但内部到底如何处理图像 + 文本仍不清楚。

作者提出:

论文目标:

👉 解析 MLLM 在层级上的功能分工


🏗️ 2. Core Idea(核心思想)

作者提出一个 layer-wise probing framework:

核心步骤:

  1. 输入 image + prompt
  2. 提取每一层的 token embedding
  3. 在每层训练 linear probe
  4. 看不同层能预测什么信息

通过这种方式判断: