标准扩散模型(DDPM、Score SDE 等)的框架假设:数据分布 $q_\text{data}(x)$ 通过一个 SDE 逐步退化为固定的高斯先验 $p_\text{prior}(x) = \mathcal{N}(0, I)$,再学习其逆过程来生成样本。
这个设计在无条件图像生成上非常成功,但对于**图像翻译(image-to-image translation)**任务来说是个根本性的缺陷——因为翻译任务的输入本身就是有意义的图像,而不是随机噪声。
| 方案 | 代表方法 | 问题 |
|---|---|---|
| 条件化扩散模型 | Pix2Pix, Palette | 缺乏理论支撑;只能从降质图→干净图单向映射,不满足 cycle consistency |
| 修改采样过程 | SDEdit | 需要手动噪化输入图像,生成质量与忠实度存在 trade-off |
| ODE Flow Matching | Rectified Flow, OT-FM | 主要验证于无条件生成;在两域差异大时(如线稿→彩图)表现差 |
| Schrödinger Bridge | DSBM, I²SB | 依赖迭代 IPF(Iterative Proportional Fitting),计算极昂贵 |
直接对两个任意配对分布之间建模一个随机过程,无需绕道高斯噪声。数学上,这对应扩散桥(Diffusion Bridge)——一种两端点都固定的扩散过程。
前向 SDE(数据 → 噪声): $$dx_t = f(x_t, t),dt + g(t),dw_t$$
逆向 SDE 依赖分数函数(score) $\nabla_{x_t} \log p(x_t)$,用去噪分数匹配(DSM)学习: $$\mathcal{L}(\theta) = \mathbb{E}\left[|s_\theta(x_t, t) - \nabla_{x_t}\log p(x_t|x_0)|^2\right]$$
关键设计:$p(x_t|x_0)$ 是高斯分布(封闭解析形式),使训练可行。
给定一个普通 SDE,可以通过 Doob's h-transform 强迫其在时刻 $T$ 精确到达给定终点 $y$:
$$dx_t = f(x_t, t),dt + g(t)^2 \underbrace{\nabla_{x_t}\log p(x_T=y|x_t)}_{\text{h-transform 漂移项}},dt + g(t),dw_t$$
这就是"扩散桥"。对于高斯转移核(VP/VE 扩散),$h$ 项有解析表达式(见下表)。
VP 桥与 VE 桥的参数对比:
| VP 桥 | VE 桥 | |
|---|---|---|
| 漂移 $f$ | $\frac{d\log\alpha_t}{dt}x_t$ | $0$ |
| 扩散 $g^2$ | $\frac{d}{dt}\sigma_t^2 - 2\frac{d\log\alpha_t}{dt}\sigma_t^2$ | $\frac{d}{dt}\sigma_t^2$ |
| h-transform | $\frac{(\alpha_t/\alpha_T)x_T - x_t}{\sigma_t^2(\text{SNR}_t/\text{SNR}_T - 1)}$ | $\frac{x_T - x_t}{\sigma_T^2 - \sigma_t^2}$ |