PixelGen 这篇论文的核心观点是:

Pixel diffusion 不是不行,而是传统的 pixel-wise supervision 太低效。

过去大家更偏向 latent diffusion,因为 latent space 更低维、更容易训练。但 PixelGen 认为,pixel diffusion 的主要问题并不是“像素空间天然不可学”,而是模型被迫平均学习每一个像素,包括大量人眼不敏感、感知价值很低的细节。

PixelGen 的解决方案很直接:

在 x-prediction 的 pixel diffusion 中加入 LPIPS 和 DINO 这类 perceptual supervision,让模型更关注人眼感知上重要的纹理、结构和语义。

最终结果是:

PixelGen 在不依赖 VAE 的情况下,让 pixel diffusion 重新变得有竞争力。


1. 这篇论文想解决什么问题?

当前图像生成的主流路线是 Latent Diffusion。

它的基本思路是:

  1. 先用 VAE 把图像压缩到 latent space;
  2. diffusion model 在 latent space 里做生成;
  3. 最后再通过 VAE decoder 还原成图像。

这样做的优点是训练更便宜、空间维度更低、优化更容易。

但 latent diffusion 也有明显问题: