<aside>
论文核心:提出一套基于线性探针的分析框架,揭示多模态大语言模型(MLLM)内部各层的功能分工。
方法:在每层训练线性分类器,配合三类受控提示变体(词汇变体、语义否定、格式变体),逐层测试模型表示如何响应不同扰动。
核心发现:跨三个模型(LLaVA-1.5、LLaVA-Next-LLaMA-3、Qwen2-VL)发现一致的四阶段结构——视觉定位 → 词汇整合 → 语义推理 → 答案解码,其中阶段结构稳定,但各阶段占用层数随基础 LLM 架构而变化。
</aside>
Multimodal LLM(MLLM)性能很强,但内部到底如何处理图像 + 文本仍不清楚。
作者提出:
论文目标:
👉 解析 MLLM 在层级上的功能分工
作者提出一个 layer-wise probing framework:
核心步骤:
通过这种方式判断: