核心问题: FlowGRPO 中不同 timestep 的 importance ratio 和 gradient scale 存在明显不平衡,使得传统 PPO clipping 不能很好地约束 policy update,最终出现 reward 持续上涨,但真实生成质量下降。
FlowGRPO 使用类似 PPO 的 clipped objective:
$L= \min \left( r_t A_t, \operatorname{clip}(r_t,1-\epsilon,1+\epsilon)A_t \right)$
其中:
$r_t= \frac{p_\theta(x_{t+1}|x_t)} {p_{\theta_{\rm old}}(x_{t+1}|x_t)}$
理论上 clipping 应该限制 policy update。
但在 Flow Matching 中,不同 timestep 的 transition distribution 不一样,因此:
$r_t \sim P(r|t)$
不同 timestep 的 ratio 会有不同的:
因此统一使用: $[1-\epsilon,1+\epsilon]$
并不一定合理。
论文发现不同 timestep 的 ratio 并不是均匀地围绕 1 分布。
尤其存在: $E[r_t] < 1$ 的现象。