来源: ICLR Blogposts 2025 原文链接: https://d2jud02ci9yv69.cloudfront.net/2025-04-28-vlm-understanding-29/blog/vlm-understanding/ 核心问题: VLM 内部机制不透明,如何用可解释性方法理解其工作原理?

<aside>

💡 核心结论

  1. 视觉信息处理具有层级性: 早期层处理上下文,中间层整合视觉-语言,最后层输出任务相关结果
  2. 图像表征是概念混合: 而非单一词语映射,这区别于文本 token 的处理方式
  3. 不同架构差异显著: LLaVA 和 BLIP 的跨模态处理机制不同,需要跨模型研究
  4. SAE 尚未用于 VLM: 这是一个重要的研究空白
  5. 微观→宏观的桥接是关键: 当前研究缺乏将底层机制与模型整体能力相连接的工作 </aside>

📌 背景与动机


🧰 五种核心方法

1. Probing(探针分析)

是什么 在模型中间层输出上训练辅助分类器(通常是线性探针),检测特定信息是否被编码。

怎么用

关键发现

发现 说明
模态优先级 预训练模型在多模态任务中倾向于优先使用语言而非视觉
跨模态交互 特定注意力头有效捕捉视觉-语言模态交互
注意力可视化 揭示图像中物体-物体的可解释关系

局限性