G²VLM 是首个将 3D几何重建 与 空间语言推理 统一于单一视觉语言模型的框架,通过让VLM原生学习3D几何特征,大幅提升空间智能。
当前主流 VLM(如 GPT-4o、Qwen2-VL)在空间理解任务上表现不足,原因在于:
人类视觉系统存在"双流假说"(Two-Streams Hypothesis):
- 腹侧流(Ventral Stream)→ "是什么":负责物体识别 → 对应 语义感知
- 背侧流(Dorsal Stream)→ "在哪里":负责空间定位 → 对应 几何感知
现有VLM只有"腹侧流",缺少"背侧流",G²VLM将两者统一。
输入:N张RGB图像序列 (I₁, I₂, ..., Iₙ)
↓
┌────────────────────────────────────────────┐
│ Mixture-of-Transformer-Experts │
│ │
│ [DINOv2编码器] [Qwen2视觉编码器] │
│ ↓ ↓ │
│ 几何感知专家 语义感知专家 │
│ (Where Pathway) (What Pathway) │
│ ↓ ↓ │
│ ←── 共享自注意力 (Self-Attention) ──→│
│ ↓ ↓ │
│ 3D几何预测头 文本解码器 │
│ (深度/点云/相机位姿) (语言输出) │
└────────────────────────────────────────────┘
| 组件 | 几何感知专家 | 语义感知专家 |
|---|---|---|
| 编码器 | DINOv2(自监督,适合低层视觉) | Qwen2-VL视觉编码器(语义丰富) |
| 目标 | 预测3D点云、深度图、相机位姿 | 多模态理解与空间问答 |
| 输出 | 相机位姿 Tᵢ ∈ SE(3)、像素对齐3D点图 Xᵢ | 自然语言回答 |
| 交互 | ← 通过共享自注意力相互增强 → |
关键设计:两个专家共享同一个自注意力层,几何特征与语义特征在每个Transformer块中自由交互。