注意: MoE 负载不均衡的问题, 需要知道的一些解决办法:

Noisy Top-K Gating, Auxiliary Load Balance Loss (本文采用)

一、核心问题

3D 视觉几何重建领域,大规模训练已被证明能学到通用表征,但继续扩大模型规模面临两大障碍:

  1. 几何监督复杂:深度、法线、点图等多任务标注质量参差不齐,真实数据含有噪声与缺失;
  2. 3D 数据高度异构:室内、室外、以物体为中心、以人为中心、动态场景分布差异极大,单一 Dense 模型难以同时应对。

二、方法概览(MoRE)

MoRE 是一个前向推理(feed-forward)基础模型,输入为任意数量的未标定 RGB 图像,一次前向即可输出多种 3D 几何量。

<aside> 💡

输入:N 张 RGB 图像 {I_i} 输出:每帧的 ($C_i, P_i, D_i, T_i, N_i$) C = 相机参数(内参+外参) P = 点图 pointmap (3×H×W) D = 深度图 (H×W) T = 特征网格,用于点追踪 (C×H×W) N = 法线图 (3×H×W)

</aside>

整体分为三大模块:Dense 视觉 Transformer 骨干 + MoE 路由机制 + 专用训练策略,采用两阶段训练:


三、方法细节

3.1 骨干网络

采用基于 VGGT 的 Dense Visual Transformer,具备交替的全局注意力(global attention)与帧级注意力(frame attention)结构。在 VGGT 原有的点图头、深度头、相机头、追踪头基础上,新增法线预测头(DPT head)。


3.2 关键创新①:置信度引导深度精修(Confidence-based Depth Refinement)