核心问题: FlowGRPO 中不同 timestep 的 importance ratio 和 gradient scale 存在明显不平衡,使得传统 PPO clipping 不能很好地约束 policy update,最终出现 reward 持续上涨,但真实生成质量下降。


1. Motivation:FlowGRPO 为什么会 Over-Optimization?

FlowGRPO 使用类似 PPO 的 clipped objective:

$L= \min \left( r_t A_t, \operatorname{clip}(r_t,1-\epsilon,1+\epsilon)A_t \right)$

其中:

$r_t= \frac{p_\theta(x_{t+1}|x_t)} {p_{\theta_{\rm old}}(x_{t+1}|x_t)}$

理论上 clipping 应该限制 policy update。

但在 Flow Matching 中,不同 timestep 的 transition distribution 不一样,因此:

$r_t \sim P(r|t)$

不同 timestep 的 ratio 会有不同的:

因此统一使用: $[1-\epsilon,1+\epsilon]$

并不一定合理。


2. 最关键发现:Ratio 存在 timestep-dependent bias

论文发现不同 timestep 的 ratio 并不是均匀地围绕 1 分布。

尤其存在: $E[r_t] < 1$ 的现象。