Self-Flow 的核心:
不依赖 DINO / CLIP 等外部视觉 Encoder,通过 Dual-Timestep(双时间步) 给不同 token 加不同程度的噪声,让 Flow Model 在完成生成任务的同时,自己学习更好的视觉 Representation。
核心链路:
$\boxed{ \text{Dual-Timestep} \rightarrow \text{信息不对称} \rightarrow \text{Self-Supervised Representation Learning} }$
普通 Flow Matching 很擅长:
学习如何生成图片。
但它不一定能学到很好的:
语义 Representation。
因为 Flow Matching 的训练目标主要是:
$v_\theta(x_t,t)\approx v^*(x_t,t)$
也就是:
给定当前 noisy image,预测正确的 velocity。
这个目标只要求模型:
$\text{noise} \rightarrow \text{clean image}$