<aside>
重构质量好的VAE不一定带来好的生成效果。
VAE 是潜在扩散模型的核心组件,负责将图像编码到潜在空间供扩散模型使用。传统上用 rFID 来衡量 VAE 质量,逻辑上重构越好应该生成越好。然而近期研究普遍发现了 重构–生成困境":rFID 优秀的 VAE 反而可能导致更差的生成 FID,而 rFID 较差的 VAE 有时生成效果更好——两者呈现出明显的负相关趋势。VAE 的重构 FID(rFID)与潜在扩散模型的生成 FID(gFID)之间相关性很差,导致难以用重构质量来预测生成质量。
对 rFID 的简单改进,计算流程如下:
| 指标 | 对应扩散阶段 | 与 gFID 的关系 |
|---|---|---|
| rFID | 扩散细化阶段 | 弱相关 |
| iFID | 扩散导航阶段 | 强相关 |
结合扩散模型泛化与幻觉领域的研究成果,解释了:
iFID 是首个被证明与扩散 gFID 具有强相关性的指标:
<aside>

左侧两图:VAE 的 rFID 值与扩散模型的 gFID 值不相关,甚至呈负相关。 右侧两图:iFID 指标与扩散模型的 gFID 值表现出很强的正相关性
</aside>
</aside>
<aside>
LDM 由两个核心组件构成:VAE(负责图像与潜在空间的映射)和扩散模型(负责在潜在空间中生成样本)。
VAE 部分
设源图像为 $X \sim p(X)$,其潜在表示为 $Z \sim q(Z|X)$(变分后验分布),重构图像为 $\hat{X} = g(Z)$。VAE 的训练目标是最小化 KL 散度与重建损失的加权组合:
$\mathcal{L}{VAE} = D{KL}(q(Z|X) | \mathcal{N}(0,I)) + \lambda\Delta(X, \hat{X})$
扩散模型部分
$\mathcal{L}{DSM} = \mathbb{E} | s\theta(Z_t, t) - \nabla_{Z_t} \log q(Z_t | Z) |^2$
扩散采样轨迹($T \to 0$)可划分为两个阶段:
| 阶段 | 时间步 | 主要作用 |
|---|---|---|
| 导航阶段 | $t$ 较大 | 确定图像的语义特征和整体结构 |
| 细化阶段 | $t$ 较小 | 细化局部细节 |
直觉假设:重建越好的 VAE → 保留更多细节 → 扩散模型学习效果越好
实际观测:重建性能更好的 VAE,反而使扩散模型训练难度更大,导致更差的生成质量。即:rFID ↓(更好)往往对应 gFID ↑(更差)。
这一反直觉现象被称为 重建–生成困境。
</aside>
<aside>
rFID:直接对真实潜在表示 $z^{(1:N)}$ 解码后与原图计算 FID,衡量 VAE 的重建质量。
gFID:从随机噪声出发,经扩散求解器生成样本后与原图计算 FID,衡量最终生成质量。
iFID(本文提出):对每个潜在表示 $z^{(i)}$,找到其在潜在空间中的最近邻 $\text{NN}(z^{(i)})$,取二者均值插值得到 $\hat{z}^{(i)}$,再解码计算 FID。衡量插值后潜在表示的有效性。


<aside>

细化阶段(t 较小):去噪结果与源图像高度相似,主要完成局部细节的精修。
导航阶段(t 较大):去噪结果与源图像差异显著,负责确定图像的整体语义结构。
</aside>
为分离两个阶段的质量,引入 gFID(t):对真实图像加噪至时间步 $t$,再从该点去噪,计算与原图的 FID。
<aside>

rFID 在细化阶段($t$ 小)与 gFID(t) 强相关;iFID 在导航阶段($t$ 大)与 gFID(t) 强相关。两者分别捕捉扩散采样的不同阶段特性。
</aside>
| 指标 | 细化阶段($t$ 小) | 导航阶段($t$ 大) |
|---|---|---|
| rFID | ✅ 强相关(PCC ≈ 1.00) | ❌ 不相关(PCC ≈ -0.06) |
| iFID | ❌ 不相关(PCC ≈ 0.06) | ✅ 强相关(PCC ≈ 0.89) |
结论:rFID 预测细化阶段,iFID 预测导航阶段,两者互补。iFID 与最终 gFID 的 PCC ≈ 0.85–0.89。
关键前提:扩散模型的泛化机制是对训练数据进行插值与组合来生成新样本。
因此:iFID 直接衡量潜在空间中插值样本的质量,与扩散生成过程天然对齐。
<aside>
如下图所示:

孤立潜在空间(左):25个高斯分布互相隔离,插值结果 $\hat{z}$ 落在数据流形之外 → iFID 差 → 扩散插值样本同样偏离流形 → 产生严重幻觉。
连通潜在空间(右):25个高斯分布相互连接,插值结果 $\hat{z}$ 保持在数据流形上 → iFID 好 → 扩散插值样本留在流形内 → 幻觉显著减少。
</aside>
两种潜在空间存在根本矛盾:
| --- | --- | --- |
这正是"重建–生成困境"的根本原因。