DiP: Taming Diffusion Models in Pixel Space

Conference: CVPR 2026

Authors: Zhennan Chen et al.

Paper: DiP: Taming Diffusion Models in Pixel Space

arXiv: 2511.18822

Code: NJU-PCALab/DiP

核心关键词: Pixel-space Diffusion / DiT / Patch Detailer Head / Global-Local Decoupling / Efficient Diffusion

论文最终版本在 ImageNet 256×256 上达到 FID 1.79,并报告相比此前像素空间方法最高约 10× 推理加速,Patch Detailer Head 仅带来约 0.3% 参数量增加。(CVF Open Access)


1. TL;DR

DiP 的核心思想:不要让 DiT 同时负责全局结构和像素级细节。

传统 Pixel-space DiT 为了保留细节,需要使用很小的 Patch:

Image
 ↓
2×2 / 4×4 Pixel Patch
 ↓
大量 Tokens
 ↓
DiT

导致 Transformer sequence length 非常长,计算成本高。

DiP 改成:

Image
 ↓
16×16 Large Pixel Patch
 ↓
少量 Tokens
 ↓
DiT
 ↓
Global Structure

但是大 Patch 会损失局部细节。

于是增加一个轻量级:

Patch Detailer Head

利用: