一句话概括:把 Stable Diffusion 这个"懂图像的大模型"微调成深度估计器,用它积累的海量视觉先验来实现跨域零样本泛化。
传统单目深度估计模型的泛化能力受限于训练数据分布。本文的直觉是:既然现代扩散模型(如 Stable Diffusion)已在互联网规模图像上训练,具备丰富的视觉世界理解能力,那么将其迁移为深度估计器(affine-invariant monocular depth estimation),应该能继承这种泛化能力。
将深度估计建模为条件去噪扩散生成任务:给定 RGB 图像 x,学习条件分布 D(d|x),即在图像条件下生成深度图 d。
z(x) 与深度潜码 z(d) 在特征维度拼接,作为 U-Net 输入| 要素 | 细节 |
|---|---|
| 训练数据 | 仅使用合成数据(Hypersim + Virtual KITTI,共约 74K 样本),无需真实深度 |
| 深度归一化 | 仿射归一化到 [-1, 1](用 2% 和 98% 百分位数线性变换),实现仿射不变性 |
| 噪声策略 | 退火多分辨率噪声(Annealed Multi-Resolution Noise):加速收敛,提升性能 |
| 训练成本 | 单卡 Nvidia RTX 4090,约 2.5 天 完成训练(18K 步,batch=32) |