0 · 核心思想根源:为什么能直接在像素空间工作?

💡 流形假设(Manifold Assumption):自然图像虽然身处高维像素空间,但实际分布在一个低维流形上。干净图像 x 在流形上,而噪声 ε 和速度 v = x − ε 天然是高维全空间的,不在流形上。

这是 Kaiming He 组 2025 年 JiT(Just Image Transformers) 论文的核心洞察(arxiv: 2511.13720)。

MiniT2I 完整继承并应用了这一原理。


1 · 模型架构:MM-JiT

MiniT2I 的去噪器是 MM-JiT(Multimodal Just Image Transformer),即把原始 JiT(类图像分类的纯图像 ViT)扩展到文本条件生成。

整体 Pipeline

文本 Prompt
   → FLAN-T5-Large(冻结) → 文本 tokens
                                          ↘
噪声图像 z_t = t·x + (1-t)·ε              MM-JiT Transformer → x̂(干净图像)
   → 切成 16×16 px patches               ↗
                                时间步 t(logit-normal 采样)

各模块细节

模块 设计 说明
图像 Tokenization 16×16 px patch(B/16) 每 patch 展平为 768 维,线性投影进 hidden dim
文本条件化 FLAN-T5-Large(冻结) cross-attention 或 joint attention 注入文本 tokens
时间步调制 AdaLN-Zero(同 DiT) t 编码为 adaLN 信号调制每个 Transformer block
网络输出 x̂(干净图像) x-prediction,区别于主流 ε/v-prediction

2 · 训练目标:Flow Matching + x-prediction

Forward Process(加噪)

z_t = t·x + (1-t)·ε
t ~ logit-normal(μ, σ²)
ε ~ N(0, I)

训练损失(x-prediction + v-loss)

x̂ = net_θ(z_t, t, text)       # 网络直接输出干净图像
v̂ = (x̂ - z_t) / (1-t)        # 转换到 v 空间
L  = E‖v̂ - v‖²               # 等价于 E‖x̂-x‖² / (1-t)²(重加权 x-loss)

⚠️ 网络直接输出 x̂(干净图像),损失在 v 空间计算。这是 x-prediction 与 v-loss 的组合(JiT 论文 Table 1 的 (3)(a) 格),对高噪声时刻(t 接近 0)自然降权,训练更稳定。