来源: ICLR Blogposts 2025
原文链接: https://d2jud02ci9yv69.cloudfront.net/2025-04-28-vlm-understanding-29/blog/vlm-understanding/
核心问题: VLM 内部机制不透明,如何用可解释性方法理解其工作原理?
<aside>
💡 核心结论
- 视觉信息处理具有层级性: 早期层处理上下文,中间层整合视觉-语言,最后层输出任务相关结果
- 图像表征是概念混合: 而非单一词语映射,这区别于文本 token 的处理方式
- 不同架构差异显著: LLaVA 和 BLIP 的跨模态处理机制不同,需要跨模型研究
- SAE 尚未用于 VLM: 这是一个重要的研究空白
- 微观→宏观的桥接是关键: 当前研究缺乏将底层机制与模型整体能力相连接的工作
</aside>
📌 背景与动机
- VLM(如 GPT-4V、LLaVA)在图像描述、VQA、多模态推理等任务上取得显著成果
- 但当前进步主要靠工程驱动,对模型内部机制缺乏科学理解
- 不透明性带来的挑战:鲁棒性差、难以泛化、高风险场景中不可信
- 本文目标: 系统综述五种机械可解释性方法在 VLM 上的应用,揭示模型如何表示、处理、整合视觉与语言信息
🧰 五种核心方法
1. Probing(探针分析)
是什么
在模型中间层输出上训练辅助分类器(通常是线性探针),检测特定信息是否被编码。
怎么用
- 探针准确率高 → 该属性被良好编码
- 探针准确率低 → 属性缺失或高度纠缠
关键发现
| 发现 |
说明 |
| 模态优先级 |
预训练模型在多模态任务中倾向于优先使用语言而非视觉 |
| 跨模态交互 |
特定注意力头有效捕捉视觉-语言模态交互 |
| 注意力可视化 |
揭示图像中物体-物体的可解释关系 |
局限性
- 高准确率 ≠ 因果关系(可能编码了但未使用)
- 任务设计需避免混淆因素