提出 DRDD(解耦残差去噪扩散模型),将扩散过程拆分为两个独立阶段,在保留域协调效果的同时,大幅降低对配对数据的依赖,实现统一、高效的图像到图像翻译。
将图像从一个域转换到另一个域,例如:
| 问题 | 描述 |
|---|---|
| 域协调效果被提前破坏 | 现有方法在单一耦合扩散过程中同时去除噪声和残差,导致"域协调"效果过早消失 |
| 数据效率低 | 需要大量配对图像训练,成本高 |
| 统一性差 | 难以用同一模型处理多种不同的翻译任务 |
💡 本文发现:向图像注入高斯噪声,不仅能让数据脱离低维流形(Manifold Lifting),还能隐式对齐不同域的特征分布——即域协调(Domain Harmonization)。
这一属性此前在扩散模型研究中未被充分挖掘。
将扩散过程解耦为两个顺序且独立的阶段:
源域图像
│
▼
【阶段一】随机噪声扩散(Stochastic Noise Diffusion)
├─ 目标:域协调 + 流形提升
├─ 训练数据:仅需大量目标域无配对图像 ✅
└─ 输出:固定噪声域中的表示
│
▼
【阶段二】确定性残差扩散(Deterministic Residual Diffusion)
├─ 目标:学习核心语义映射
├─ 在"固定噪声域"内完成,保留阶段一的协调效果
└─ 输出:目标域图像