📄 Hidden in Plain Sight

核心一句话:VLM 的视觉编码器其实已经拥有足够强的视觉表征,但语言模型组件根本没有好好利用它们——视觉信息就藏在模型里,却被忽视了。


🧩 背景与问题

VLM 的标准架构是三件套:视觉编码器(ViT)+ 投影层(Projector)+ 语言模型(LLM)。

大家普遍认为 VLM 比单独的视觉模型更强——毕竟加了语言模型,理解能力应该更全面。但这篇论文做了一个很直接的对比实验:

在纯视觉任务上,直接读取视觉编码器的表征 vs. 用 VLM 完整推理——哪个更好?

结果非常出乎意料:VLM 的表现大幅低于它自己内部的视觉编码器,很多任务直接跌落到接近随机猜测的水平。


🔬 实验设计

任务类型:"视觉中心"任务(Vision-Centric Tasks)

论文刻意选择只需要看图、不依赖背景知识的任务,目的是排除 LLM 知识库的干扰,专注考察视觉理解能力。

任务 数据集 描述
深度估计 CV-Bench 判断图中两个物体哪个离镜头更近
语义对应 BLINK 找两张图中语义对应的像素点
物体功能对应 MOCHI 匹配两个物体中功能相同的部位
低层次匹配 BLINK/HPatches 同场景不同视角/光照下的像素匹配
3D 物体感知 MOCHI 三维形状理解
艺术风格 自建 风格识别

对比方式

测试模型

受控实验(视觉编码器权重完全不变):DINOv2-L、ViT-IN1k-L、CLIP-L、SigLIP-L,统一接 Vicuña v1.5 作为 LLM

泛化验证:Qwen-VL、Phi-3-V、InternVL 等主流开源 VLM