Paper: MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE
核心关键词: Flow-based RL / GRPO / ODE / SDE / Timestep Selection / Sliding Window / Exploration / Efficient RL
MixGRPO 通过在局部 timestep window 内使用 SDE + GRPO,在 window 外使用 ODE,将 Flow-based GRPO 从“全轨迹 RL”变成“局部时间段 RL”,显著降低训练成本。
核心:
ODE outside window+SDE + GRPO inside window

Flow-based generation:
$x_T \rightarrow x_{t_1}\rightarrow x_{t_2} \rightarrow \cdots \rightarrow x_0$
假设有 N 个 denoising steps。
FlowGRPO 对整个 trajectory 进行 policy optimization:
$L_{GRPO} = \sum_{t=1}^{N} L_t$
因此:
$\text{RL Cost} \propto N$
当 N较大时: