📌 一句话概括

G²VLM 是首个将 3D几何重建 与 空间语言推理 统一于单一视觉语言模型的框架,通过让VLM原生学习3D几何特征,大幅提升空间智能。


🔍 问题背景

现有VLM的空间智能缺陷

当前主流 VLM(如 GPT-4o、Qwen2-VL)在空间理解任务上表现不足,原因在于:

核心洞察

人类视觉系统存在"双流假说"(Two-Streams Hypothesis):

现有VLM只有"腹侧流",缺少"背侧流",G²VLM将两者统一。


🏗️ 模型架构

整体设计:混合Transformer专家(MoT)

输入:N张RGB图像序列 (I₁, I₂, ..., Iₙ)
         ↓
┌────────────────────────────────────────────┐
│        Mixture-of-Transformer-Experts       │
│                                            │
│  [DINOv2编码器]        [Qwen2视觉编码器]    │
│        ↓                      ↓            │
│  几何感知专家           语义感知专家         │
│  (Where Pathway)       (What Pathway)      │
│        ↓                      ↓            │
│         ←── 共享自注意力 (Self-Attention) ──→│
│        ↓                      ↓            │
│  3D几何预测头           文本解码器          │
│  (深度/点云/相机位姿)    (语言输出)          │
└────────────────────────────────────────────┘

两个核心专家

组件 几何感知专家 语义感知专家
编码器 DINOv2(自监督,适合低层视觉) Qwen2-VL视觉编码器(语义丰富)
目标 预测3D点云、深度图、相机位姿 多模态理解与空间问答
输出 相机位姿 Tᵢ ∈ SE(3)、像素对齐3D点图 Xᵢ 自然语言回答
交互 ← 通过共享自注意力相互增强 →

关键设计:两个专家共享同一个自注意力层,几何特征与语义特征在每个Transformer块中自由交互。

为何用双编码器?