🧩 核心问题

现有方法(DUSt3R、VGGT 等)都依赖一个"参考视图"作为全局坐标系原点。这带来两个根本问题:

π³ 的目标:彻底消除这一归纳偏置,实现真正的排列等变性(Permutation Equivariance)。 affine-invariant camera pose and a scale-invariant local pointmap

一种新颖的、完全置换等变的架构,消除了这种偏置。 我们的模型以纯相对的、逐视图的方式预测仿射不变的相机位姿和尺度不变的点图,完全消除了对全局坐标系的依赖。


🏗️ 方法实现细节

1. 排列等变架构

形式化定义

输入 N 张图像序列 $S = (I_1, \ldots, I_N)$,网络 $\phi$输出三元组:

$\phi(S) = \big((T_1,\ldots,T_N),\ (X_1,\ldots,X_N),\ (C_1,\ldots,C_N)\big)$

排列等变性要求:对任意排列 $\pi$,满足

$\phi(P_\pi(S)) = P_\pi(\phi(S))$

关键实现:去除所有顺序依赖组件

操作 之前方法(VGGT 等) π³
帧位置编码 ✅ 有(区分不同帧) ❌ 去除
参考帧特殊 Token ✅ 有(Type A:拼接 / Type B:可学习 Embedding) ❌ 去除
输出坐标系 全局参考帧坐标系 每帧自身坐标系