核心一句话:VLM 的视觉编码器其实已经拥有足够强的视觉表征,但语言模型组件根本没有好好利用它们——视觉信息就藏在模型里,却被忽视了。
VLM 的标准架构是三件套:视觉编码器(ViT)+ 投影层(Projector)+ 语言模型(LLM)。
大家普遍认为 VLM 比单独的视觉模型更强——毕竟加了语言模型,理解能力应该更全面。但这篇论文做了一个很直接的对比实验:
在纯视觉任务上,直接读取视觉编码器的表征 vs. 用 VLM 完整推理——哪个更好?
结果非常出乎意料:VLM 的表现大幅低于它自己内部的视觉编码器,很多任务直接跌落到接近随机猜测的水平。
论文刻意选择只需要看图、不依赖背景知识的任务,目的是排除 LLM 知识库的干扰,专注考察视觉理解能力。
| 任务 | 数据集 | 描述 |
|---|---|---|
| 深度估计 | CV-Bench | 判断图中两个物体哪个离镜头更近 |
| 语义对应 | BLINK | 找两张图中语义对应的像素点 |
| 物体功能对应 | MOCHI | 匹配两个物体中功能相同的部位 |
| 低层次匹配 | BLINK/HPatches | 同场景不同视角/光照下的像素匹配 |
| 3D 物体感知 | MOCHI | 三维形状理解 |
| 艺术风格 | 自建 | 风格识别 |
受控实验(视觉编码器权重完全不变):DINOv2-L、ViT-IN1k-L、CLIP-L、SigLIP-L,统一接 Vicuña v1.5 作为 LLM
泛化验证:Qwen-VL、Phi-3-V、InternVL 等主流开源 VLM