🧠 核心思想

一句话概括:把 Stable Diffusion 这个"懂图像的大模型"微调成深度估计器,用它积累的海量视觉先验来实现跨域零样本泛化。

传统单目深度估计模型的泛化能力受限于训练数据分布。本文的直觉是:既然现代扩散模型(如 Stable Diffusion)已在互联网规模图像上训练,具备丰富的视觉世界理解能力,那么将其迁移为深度估计器(affine-invariant monocular depth estimation),应该能继承这种泛化能力。


🔍 背景与问题


🏗️ 方法:Marigold

整体框架

将深度估计建模为条件去噪扩散生成任务:给定 RGB 图像 x,学习条件分布 D(d|x),即在图像条件下生成深度图 d。

网络架构

微调协议

要素 细节
训练数据 仅使用合成数据(Hypersim + Virtual KITTI,共约 74K 样本),无需真实深度
深度归一化 仿射归一化到 [-1, 1](用 2% 和 98% 百分位数线性变换),实现仿射不变性
噪声策略 退火多分辨率噪声(Annealed Multi-Resolution Noise):加速收敛,提升性能
训练成本 单卡 Nvidia RTX 4090,约 2.5 天 完成训练(18K 步,batch=32)