Conference: CVPR 2026
Authors: Zhennan Chen et al.
Paper: DiP: Taming Diffusion Models in Pixel Space
arXiv: 2511.18822
Code: NJU-PCALab/DiP
核心关键词: Pixel-space Diffusion / DiT / Patch Detailer Head / Global-Local Decoupling / Efficient Diffusion
论文最终版本在 ImageNet 256×256 上达到 FID 1.79,并报告相比此前像素空间方法最高约 10× 推理加速,Patch Detailer Head 仅带来约 0.3% 参数量增加。(CVF Open Access)
DiP 的核心思想:不要让 DiT 同时负责全局结构和像素级细节。
传统 Pixel-space DiT 为了保留细节,需要使用很小的 Patch:
Image
↓
2×2 / 4×4 Pixel Patch
↓
大量 Tokens
↓
DiT
导致 Transformer sequence length 非常长,计算成本高。
DiP 改成:
Image
↓
16×16 Large Pixel Patch
↓
少量 Tokens
↓
DiT
↓
Global Structure
但是大 Patch 会损失局部细节。
于是增加一个轻量级:
Patch Detailer Head
利用: