会议 WACV 2025 Oral
本文针对基于扩散模型的图像条件密集预测任务(以单目深度估计为核心),提出两项贡献:其一,发现并修正了 Marigold 等工作推理管线中长期被忽视的时间步对齐错误,使单步推理性能与原始多步 ensemble 持平,推理速度提升超过 200 倍;其二,在修正后的单步模型基础上,通过端到端微调(E2E FT)引入任务特定损失,得到完全确定性的单步估计器,在五个 zero-shot 基准上超越全部现有扩散方法。此外,直接对 Stable Diffusion 原始权重施以相同微调流程同样可达 SOTA 水平,对此前关于"图像条件预训练必要性"的结论提出质疑。
Marigold将单目深度估计重新表述为图像条件生成问题,在标准 zero-shot 基准上取得了当时最优结果。然而,其推理需要在 50 个去噪步骤上进行多次 ensemble,延迟高达数十秒,限制了实用部署。后续工作(如 GeoWizard)延续了相同的推理范式,普遍认为扩散模型在此类任务上的推理效率难以改善。
本文的出发点是:这一"低效"是否真的源于扩散模型本身的结构性限制?
Marigold 推理时采用 leading timestep spacing,即在从 T=1000 到 t=0 的离散时间步序列中,以前导方式分配步骤。这导致在少步推理(如 1 步)场景下,模型实际接收的 timestep 编号与输入 latent 的真实噪声水平之间存在系统性偏差,模型的噪声预期与实际不匹配,输出质量严重下降。
将 DDIM scheduler 的时间步排布从 leading → trailing,确保每个去噪步骤的 timestep 编号与对应噪声水平严格对齐。
| 推理配置 | 步数 | Ensemble | 相对速度 | 性能 |
|---|---|---|---|---|
| Marigold 原始最优配置 | 50 | 10× | 1× | SOTA(原文) |
| Marigold + trailing fix | 1 | 1× | >200× | ≈ 持平 |
该 Bug 此前已在通用扩散模型文献中被报告(Karras et al.),但其在图像条件方法中的显著影响尚未被指出。
在修复后的单步模型基础上,进一步通过任务特定训练将模型从概率采样器转化为确定性回归器。