一、摘要:

<aside>

iFID:插值FID——一种与扩散模型生成质量强相关的新指标

核心问题

重构质量好的VAE不一定带来好的生成效果。

VAE 是潜在扩散模型的核心组件,负责将图像编码到潜在空间供扩散模型使用。传统上用 rFID 来衡量 VAE 质量,逻辑上重构越好应该生成越好。然而近期研究普遍发现了 重构–生成困境":rFID 优秀的 VAE 反而可能导致更差的生成 FID,而 rFID 较差的 VAE 有时生成效果更好——两者呈现出明显的负相关趋势。VAE 的重构 FID(rFID)与潜在扩散模型的生成 FID(gFID)之间相关性很差,导致难以用重构质量来预测生成质量。

提出方法:插值 FID(iFID)

对 rFID 的简单改进,计算流程如下:

  1. 对数据集中每个样本,在潜在空间中检索其最近邻(NN)
  2. 对两者的潜在表示进行插值
  3. 将插值结果解码回图像空间
  4. 计算解码样本与原始数据集之间的 FID

核心发现

指标 对应扩散阶段 与 gFID 的关系
rFID 扩散细化阶段 弱相关
iFID 扩散导航阶段 强相关

理论解释

结合扩散模型泛化与幻觉领域的研究成果,解释了:

实验结果

iFID 是首个被证明与扩散 gFID 具有强相关性的指标:

<aside>

image.png

左侧两图:VAE 的 rFID 值与扩散模型的 gFID 值不相关,甚至呈负相关。 右侧两图:iFID 指标与扩散模型的 gFID 值表现出很强的正相关性

</aside>

</aside>

二、预备知识:

<aside>

(a) 潜在扩散模型(LDM)

LDM 由两个核心组件构成:VAE(负责图像与潜在空间的映射)和扩散模型(负责在潜在空间中生成样本)。

VAE 部分

设源图像为 $X \sim p(X)$,其潜在表示为 $Z \sim q(Z|X)$(变分后验分布),重构图像为 $\hat{X} = g(Z)$。VAE 的训练目标是最小化 KL 散度与重建损失的加权组合:

$\mathcal{L}{VAE} = D{KL}(q(Z|X) | \mathcal{N}(0,I)) + \lambda\Delta(X, \hat{X})$

扩散模型部分

$\mathcal{L}{DSM} = \mathbb{E} | s\theta(Z_t, t) - \nabla_{Z_t} \log q(Z_t | Z) |^2$


(b) 扩散采样的两个阶段

扩散采样轨迹($T \to 0$)可划分为两个阶段:

阶段 时间步 主要作用
导航阶段 $t$ 较大 确定图像的语义特征和整体结构
细化阶段 $t$ 较小 细化局部细节

(c) 重建–生成困境

直觉假设:重建越好的 VAE → 保留更多细节 → 扩散模型学习效果越好

实际观测:重建性能更好的 VAE,反而使扩散模型训练难度更大,导致更差的生成质量。即:rFID ↓(更好)往往对应 gFID ↑(更差)。

这一反直觉现象被称为 重建–生成困境。


</aside>

三、使重建 FID 能够预测生成 FID

<aside>

(a) 核心指标定义

rFID:直接对真实潜在表示 $z^{(1:N)}$ 解码后与原图计算 FID,衡量 VAE 的重建质量。

gFID:从随机噪声出发,经扩散求解器生成样本后与原图计算 FID,衡量最终生成质量。

iFID(本文提出):对每个潜在表示 $z^{(i)}$,找到其在潜在空间中的最近邻 $\text{NN}(z^{(i)})$,取二者均值插值得到 $\hat{z}^{(i)}$,再解码计算 FID。衡量插值后潜在表示的有效性。

image.png

image.png


(b) rFID、iFID 与扩散两阶段的对应关系

<aside>

image.png

细化阶段(t 较小):去噪结果与源图像高度相似,主要完成局部细节的精修。

导航阶段(t 较大):去噪结果与源图像差异显著,负责确定图像的整体语义结构。

</aside>

为分离两个阶段的质量,引入 gFID(t):对真实图像加噪至时间步 $t$,再从该点去噪,计算与原图的 FID。

<aside>

image.png

rFID 在细化阶段($t$ 小)与 gFID(t) 强相关;iFID 在导航阶段($t$ 大)与 gFID(t) 强相关。两者分别捕捉扩散采样的不同阶段特性。

</aside>

指标 细化阶段($t$ 小) 导航阶段($t$ 大)
rFID ✅ 强相关(PCC ≈ 1.00) ❌ 不相关(PCC ≈ -0.06)
iFID ❌ 不相关(PCC ≈ 0.06) ✅ 强相关(PCC ≈ 0.89)

结论:rFID 预测细化阶段,iFID 预测导航阶段,两者互补。iFID 与最终 gFID 的 PCC ≈ 0.85–0.89。


(c) 为什么 iFID 能预测生成质量?

关键前提:扩散模型的泛化机制是对训练数据进行插值与组合来生成新样本。

因此:iFID 直接衡量潜在空间中插值样本的质量,与扩散生成过程天然对齐。


为什么重建与生成质量负相关?

<aside>

如下图所示:

image.png

孤立潜在空间(左):25个高斯分布互相隔离,插值结果 $\hat{z}$ 落在数据流形之外 → iFID 差 → 扩散插值样本同样偏离流形 → 产生严重幻觉。

连通潜在空间(右):25个高斯分布相互连接,插值结果 $\hat{z}$ 保持在数据流形上 → iFID 好 → 扩散插值样本留在流形内 → 幻觉显著减少。

</aside>

两种潜在空间存在根本矛盾:

| --- | --- | --- |

这正是"重建–生成困境"的根本原因。


主要结论

  1. rFID 并非与生成质量无关,而是对应细化阶段;iFID 对应导航阶段。
  2. iFID 是首个与 gFID 强相关的指标(PCC ≈ 0.85),因为它直接衡量插值有效性。
  3. 重建指标与生成质量负相关,根源在于两者对潜在空间结构的需求相互对立。 </aside>