核心思想:

将 Flow-GRPO 的 trajectory-level sparse reward 转换成 timestep-level dense reward,解决 Flow Matching RL 中的 Temporal Credit Assignment 问题,并进一步让 exploration 具有 timestep-aware 特性。


1. 为什么需要 DenseGRPO?

Flow-GRPO 的生成过程:$x_T \rightarrow x_{T-1}\rightarrow\cdots\rightarrow x_0$

最终只对生成图像 $x_0$ 计算:$R=R(x_0)$

然后将同一个 trajectory-level Advantage 用于整条 trajectory。

问题

不知道:

到底是哪一个 denoising timestep 对最终 reward 贡献最大?

因此存在:$\boxed{\text{Temporal Credit Assignment}}$


2. Flow-GRPO 的 Sparse Reward

传统 Flow-GRPO: $A_i= \frac{R_i-\operatorname{mean}(R)} {\operatorname{std}(R)}$

一条 trajectory 中: $A_{i,t}\approx A_i$

即:

t=T      A
 ↓
t=T-1    A
 ↓
...
 ↓
t=1      A

所有 timestep 基本共享同一个 reward signal。


3. DenseGRPO 的核心 Idea

保存正常 denoising trajectory 中的 intermediate latent: