一、背景与动机

标准扩散模型的局限

标准扩散模型(DDPM、Score SDE 等)的框架假设:数据分布 $q_\text{data}(x)$ 通过一个 SDE 逐步退化为固定的高斯先验 $p_\text{prior}(x) = \mathcal{N}(0, I)$,再学习其逆过程来生成样本。

这个设计在无条件图像生成上非常成功,但对于**图像翻译(image-to-image translation)**任务来说是个根本性的缺陷——因为翻译任务的输入本身就是有意义的图像,而不是随机噪声。

现有解决方案的不足

方案 代表方法 问题
条件化扩散模型 Pix2Pix, Palette 缺乏理论支撑;只能从降质图→干净图单向映射,不满足 cycle consistency
修改采样过程 SDEdit 需要手动噪化输入图像,生成质量与忠实度存在 trade-off
ODE Flow Matching Rectified Flow, OT-FM 主要验证于无条件生成;在两域差异大时(如线稿→彩图)表现差
Schrödinger Bridge DSBM, I²SB 依赖迭代 IPF(Iterative Proportional Fitting),计算极昂贵

DDBM 的出发点

直接对两个任意配对分布之间建模一个随机过程,无需绕道高斯噪声。数学上,这对应扩散桥(Diffusion Bridge)——一种两端点都固定的扩散过程。


二、数学基础

2.1 标准扩散模型回顾

前向 SDE(数据 → 噪声): $$dx_t = f(x_t, t),dt + g(t),dw_t$$

逆向 SDE 依赖分数函数(score) $\nabla_{x_t} \log p(x_t)$,用去噪分数匹配(DSM)学习: $$\mathcal{L}(\theta) = \mathbb{E}\left[|s_\theta(x_t, t) - \nabla_{x_t}\log p(x_t|x_0)|^2\right]$$

关键设计:$p(x_t|x_0)$ 是高斯分布(封闭解析形式),使训练可行。

2.2 Doob's h-Transform:让扩散过程到达指定终点

给定一个普通 SDE,可以通过 Doob's h-transform 强迫其在时刻 $T$ 精确到达给定终点 $y$:

$$dx_t = f(x_t, t),dt + g(t)^2 \underbrace{\nabla_{x_t}\log p(x_T=y|x_t)}_{\text{h-transform 漂移项}},dt + g(t),dw_t$$

这就是"扩散桥"。对于高斯转移核(VP/VE 扩散),$h$ 项有解析表达式(见下表)。

VP 桥与 VE 桥的参数对比:

VP 桥 VE 桥
漂移 $f$ $\frac{d\log\alpha_t}{dt}x_t$ $0$
扩散 $g^2$ $\frac{d}{dt}\sigma_t^2 - 2\frac{d\log\alpha_t}{dt}\sigma_t^2$ $\frac{d}{dt}\sigma_t^2$
h-transform $\frac{(\alpha_t/\alpha_T)x_T - x_t}{\sigma_t^2(\text{SNR}_t/\text{SNR}_T - 1)}$ $\frac{x_T - x_t}{\sigma_T^2 - \sigma_t^2}$