现有方法(DUSt3R、VGGT 等)都依赖一个"参考视图"作为全局坐标系原点。这带来两个根本问题:
π³ 的目标:彻底消除这一归纳偏置,实现真正的排列等变性(Permutation Equivariance)。 affine-invariant camera pose and a scale-invariant local pointmap
一种新颖的、完全置换等变的架构,消除了这种偏置。 我们的模型以纯相对的、逐视图的方式预测仿射不变的相机位姿和尺度不变的点图,完全消除了对全局坐标系的依赖。
形式化定义
输入 N 张图像序列 $S = (I_1, \ldots, I_N)$,网络 $\phi$输出三元组:
$\phi(S) = \big((T_1,\ldots,T_N),\ (X_1,\ldots,X_N),\ (C_1,\ldots,C_N)\big)$
排列等变性要求:对任意排列 $\pi$,满足
$\phi(P_\pi(S)) = P_\pi(\phi(S))$
关键实现:去除所有顺序依赖组件
| 操作 | 之前方法(VGGT 等) | π³ |
|---|---|---|
| 帧位置编码 | ✅ 有(区分不同帧) | ❌ 去除 |
| 参考帧特殊 Token | ✅ 有(Type A:拼接 / Type B:可学习 Embedding) | ❌ 去除 |
| 输出坐标系 | 全局参考帧坐标系 | 每帧自身坐标系 |