1. 一句话理解

Self-Flow 的核心:

不依赖 DINO / CLIP 等外部视觉 Encoder,通过 Dual-Timestep(双时间步) 给不同 token 加不同程度的噪声,让 Flow Model 在完成生成任务的同时,自己学习更好的视觉 Representation。

核心链路:

$\boxed{ \text{Dual-Timestep} \rightarrow \text{信息不对称} \rightarrow \text{Self-Supervised Representation Learning} }$


2. Self-Flow 要解决什么问题?

普通 Flow Matching 很擅长:

学习如何生成图片。

但它不一定能学到很好的:

语义 Representation。

因为 Flow Matching 的训练目标主要是:

$v_\theta(x_t,t)\approx v^*(x_t,t)$

也就是:

给定当前 noisy image,预测正确的 velocity。

这个目标只要求模型:

$\text{noise} \rightarrow \text{clean image}$