当前视觉表示学习存在两大范式,各有短板:
| 范式 | 代表方法 | 优势 | 不足 |
|---|---|---|---|
| 视觉-语言对比学习(VL) | CLIP、SigLIP | 全局语义对齐、零样本迁移 | 缺乏空间精度 |
| 自监督学习(SSL) | MAE、DINO、DINOv2 | 局部结构建模 | 缺乏高层语义理解 |
核心观点:这两类范式本质上是互补的,可以整合进统一的多任务框架,并辅以密集空间监督信号加以增强。
"these paradigms remain bifurcated, primarily focusing on either global semantics or local regularities while leaving fine-grained spatial and geometric reasoning as underconstrained emergent properties"
尽管这些范式取得了成功,但它们仍然处于分叉状态,主要侧重于全局语义或局部规律,而将细粒度的空间和几何推理作为一种约束不足的涌现属性。
为什么这句话重要?
"underconstrained emergent property" 这个措辞极为精准,其潜台词是:VL 和 SSL 并不是"不能"做空间推理,而是从来没有显式要求模型去学它。空间几何能力如果出现了,只是训练过程中无意间涌现的副产品,而不是被优化目标约束出来的能力。既然没有约束,就没有保障。
这与"模型不擅长空间推理"是两个完全不同的诊断:
作者用这个词,实际上已经在为解法铺路:既然是 underconstrained,解法就是加约束——即引入显式的深度和 grounding 监督。问题的诊断与解法形成了干净的逻辑闭环。
① 两大范式本质上是互补的,而非竞争的 VL 学全局语义,SSL 学局部结构——过去大家把这两条路线视为两个阵营。作者第一个论点就是:它们天然互补,应该被整合进一个框架。视角的转变本身就是一个强论点。
② 细粒度空间推理是两大范式共同的盲区 VL 和 SSL 在各自维度卷得很深,却都把空间几何理解当成"自然涌现的副产品",而非显式学习目标。作者指出这是一个系统性缺陷,不是某一类方法独有的问题。
③ 视觉预训练可以借鉴 LLM 的哲学,但要清醒认识差异 LLM 通过同时吸收翻译、摘要、问答等多样化任务变得通用。作者将这个成功逻辑类比到视觉领域,但随即承认视觉任务天然异构(不像语言的离散序列),直接照搬有难度。这种"类比 + 清醒认识局限"的写法比简单类比更有说服力。
④ 伪标签即使不完美,也能有效扩展监督信号 只要引入了互补的任务方向,表示空间就会向多粒度统一的方向移动。这是一个务实的论断——不追求完美标注,而是用高容量 expert 模型批量生产"够用"的监督信号。