核心思想:
将 Flow-GRPO 的 trajectory-level sparse reward 转换成 timestep-level dense reward,解决 Flow Matching RL 中的 Temporal Credit Assignment 问题,并进一步让 exploration 具有 timestep-aware 特性。
Flow-GRPO 的生成过程:$x_T \rightarrow x_{T-1}\rightarrow\cdots\rightarrow x_0$
最终只对生成图像 $x_0$ 计算:$R=R(x_0)$
然后将同一个 trajectory-level Advantage 用于整条 trajectory。
不知道:
到底是哪一个 denoising timestep 对最终 reward 贡献最大?
因此存在:$\boxed{\text{Temporal Credit Assignment}}$
传统 Flow-GRPO: $A_i= \frac{R_i-\operatorname{mean}(R)} {\operatorname{std}(R)}$
一条 trajectory 中: $A_{i,t}\approx A_i$
即:
t=T A
↓
t=T-1 A
↓
...
↓
t=1 A
所有 timestep 基本共享同一个 reward signal。
保存正常 denoising trajectory 中的 intermediate latent: