Method: DGPO (Direct Group Preference Optimization)
Conference: ICLR 2026
DGPO 保留 GRPO 的 Group Relative Preference,但去掉 Policy Gradient,从而不再需要把 Diffusion/Flow Model 转成 SDE,可以直接使用 deterministic ODE 进行 online preference optimization。
核心变化:
Flow-GRPO
GRPO
↓
Policy Gradient
↓
需要 stochastic policy
↓
SDE rollout
↓
计算昂贵
DGPO
Group Relative Preference
↓
Direct Preference Optimization
↓
不需要 Policy Gradient
↓
不需要 stochastic policy
↓
ODE rollout
LLM 的 GRPO 可以直接计算: $\nabla_\theta \log \pi_\theta(y|x)$
因为 LLM 本身就是 stochastic policy。
但是 Flow Matching / Diffusion 模型通常使用 ODE: $\frac{dx}{dt}=v_\theta(x,t,c)$
给定初始 noise: $x_T$
ODE trajectory 基本是 deterministic: $x_T \rightarrow x_0$
因此不像 LLM 那样天然具有容易计算的 trajectory probability。
Flow-GRPO 的思路:
把 deterministic ODE 转成 stochastic SDE,使 diffusion model 可以套 GRPO / policy gradient。
SDE: $dx=f_\theta(x,t)dt+g(t)dW_t$
于是可以定义 stochastic trajectory probability,并进行 policy gradient。