Paper: MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE

核心关键词: Flow-based RL / GRPO / ODE / SDE / Timestep Selection / Sliding Window / Exploration / Efficient RL


1. 一句话总结

MixGRPO 通过在局部 timestep window 内使用 SDE + GRPO,在 window 外使用 ODE,将 Flow-based GRPO 从“全轨迹 RL”变成“局部时间段 RL”,显著降低训练成本。

核心:

ODE outside window+SDE + GRPO inside window

image.png


2. 背景:Flow GRPO 为什么计算昂贵?

Flow-based generation:

$x_T \rightarrow x_{t_1}\rightarrow x_{t_2} \rightarrow \cdots \rightarrow x_0$

假设有 N 个 denoising steps。

FlowGRPO 对整个 trajectory 进行 policy optimization:

$L_{GRPO} = \sum_{t=1}^{N} L_t$

因此:

$\text{RL Cost} \propto N$

当 N较大时: