注意: MoE 负载不均衡的问题, 需要知道的一些解决办法:
Noisy Top-K Gating, Auxiliary Load Balance Loss (本文采用)
3D 视觉几何重建领域,大规模训练已被证明能学到通用表征,但继续扩大模型规模面临两大障碍:
MoRE 是一个前向推理(feed-forward)基础模型,输入为任意数量的未标定 RGB 图像,一次前向即可输出多种 3D 几何量。
<aside> 💡
输入:N 张 RGB 图像 {I_i} 输出:每帧的 ($C_i, P_i, D_i, T_i, N_i$) C = 相机参数(内参+外参) P = 点图 pointmap (3×H×W) D = 深度图 (H×W) T = 特征网格,用于点追踪 (C×H×W) N = 法线图 (3×H×W)
</aside>
整体分为三大模块:Dense 视觉 Transformer 骨干 + MoE 路由机制 + 专用训练策略,采用两阶段训练:
采用基于 VGGT 的 Dense Visual Transformer,具备交替的全局注意力(global attention)与帧级注意力(frame attention)结构。在 VGGT 原有的点图头、深度头、相机头、追踪头基础上,新增法线预测头(DPT head)。