PixelGen 这篇论文的核心观点是:
Pixel diffusion 不是不行,而是传统的 pixel-wise supervision 太低效。
过去大家更偏向 latent diffusion,因为 latent space 更低维、更容易训练。但 PixelGen 认为,pixel diffusion 的主要问题并不是“像素空间天然不可学”,而是模型被迫平均学习每一个像素,包括大量人眼不敏感、感知价值很低的细节。
PixelGen 的解决方案很直接:
在 x-prediction 的 pixel diffusion 中加入 LPIPS 和 DINO 这类 perceptual supervision,让模型更关注人眼感知上重要的纹理、结构和语义。
最终结果是:
PixelGen 在不依赖 VAE 的情况下,让 pixel diffusion 重新变得有竞争力。
当前图像生成的主流路线是 Latent Diffusion。
它的基本思路是:
这样做的优点是训练更便宜、空间维度更低、优化更容易。
但 latent diffusion 也有明显问题: