🧭 一句话总结

提出 DRDD(解耦残差去噪扩散模型),将扩散过程拆分为两个独立阶段,在保留域协调效果的同时,大幅降低对配对数据的依赖,实现统一、高效的图像到图像翻译。


🔍 研究背景与问题

任务:图像到图像翻译(I2I Translation)

将图像从一个域转换到另一个域,例如:

现有扩散模型的局限

问题 描述
域协调效果被提前破坏 现有方法在单一耦合扩散过程中同时去除噪声和残差,导致"域协调"效果过早消失
数据效率低 需要大量配对图像训练,成本高
统一性差 难以用同一模型处理多种不同的翻译任务

被忽视的关键属性

💡 本文发现:向图像注入高斯噪声,不仅能让数据脱离低维流形(Manifold Lifting),还能隐式对齐不同域的特征分布——即域协调(Domain Harmonization)。

这一属性此前在扩散模型研究中未被充分挖掘。


🏗️ 方法:DRDD 核心设计

整体框架

将扩散过程解耦为两个顺序且独立的阶段:

源域图像
    │
    ▼
【阶段一】随机噪声扩散(Stochastic Noise Diffusion)
    ├─ 目标:域协调 + 流形提升
    ├─ 训练数据:仅需大量目标域无配对图像 ✅
    └─ 输出:固定噪声域中的表示
    │
    ▼
【阶段二】确定性残差扩散(Deterministic Residual Diffusion)
    ├─ 目标:学习核心语义映射
    ├─ 在"固定噪声域"内完成,保留阶段一的协调效果
    └─ 输出:目标域图像

两阶段对比