💡 流形假设(Manifold Assumption):自然图像虽然身处高维像素空间,但实际分布在一个低维流形上。干净图像 x 在流形上,而噪声 ε 和速度 v = x − ε 天然是高维全空间的,不在流形上。
这是 Kaiming He 组 2025 年 JiT(Just Image Transformers) 论文的核心洞察(arxiv: 2511.13720)。
MiniT2I 完整继承并应用了这一原理。
MiniT2I 的去噪器是 MM-JiT(Multimodal Just Image Transformer),即把原始 JiT(类图像分类的纯图像 ViT)扩展到文本条件生成。
文本 Prompt
→ FLAN-T5-Large(冻结) → 文本 tokens
↘
噪声图像 z_t = t·x + (1-t)·ε MM-JiT Transformer → x̂(干净图像)
→ 切成 16×16 px patches ↗
时间步 t(logit-normal 采样)
| 模块 | 设计 | 说明 |
|---|---|---|
| 图像 Tokenization | 16×16 px patch(B/16) | 每 patch 展平为 768 维,线性投影进 hidden dim |
| 文本条件化 | FLAN-T5-Large(冻结) | cross-attention 或 joint attention 注入文本 tokens |
| 时间步调制 | AdaLN-Zero(同 DiT) | t 编码为 adaLN 信号调制每个 Transformer block |
| 网络输出 | x̂(干净图像) | x-prediction,区别于主流 ε/v-prediction |
z_t = t·x + (1-t)·ε
t ~ logit-normal(μ, σ²)
ε ~ N(0, I)
x̂ = net_θ(z_t, t, text) # 网络直接输出干净图像
v̂ = (x̂ - z_t) / (1-t) # 转换到 v 空间
L = E‖v̂ - v‖² # 等价于 E‖x̂-x‖² / (1-t)²(重加权 x-loss)
⚠️ 网络直接输出 x̂(干净图像),损失在 v 空间计算。这是 x-prediction 与 v-loss 的组合(JiT 论文 Table 1 的 (3)(a) 格),对高噪声时刻(t 接近 0)自然降权,训练更稳定。