Method: DGPO (Direct Group Preference Optimization)

Conference: ICLR 2026

Paper: https://arxiv.org/abs/2510.08425

Code: https://github.com/Luo-Yihong/DGPO


1. 一句话总结

DGPO 保留 GRPO 的 Group Relative Preference,但去掉 Policy Gradient,从而不再需要把 Diffusion/Flow Model 转成 SDE,可以直接使用 deterministic ODE 进行 online preference optimization。

核心变化:

Flow-GRPO
GRPO
 ↓
Policy Gradient
 ↓
需要 stochastic policy
 ↓
SDE rollout
 ↓
计算昂贵

DGPO
Group Relative Preference
 ↓
Direct Preference Optimization
 ↓
不需要 Policy Gradient
 ↓
不需要 stochastic policy
 ↓
ODE rollout

2. 为什么 Diffusion GRPO 很麻烦?

LLM 的 GRPO 可以直接计算: $\nabla_\theta \log \pi_\theta(y|x)$

因为 LLM 本身就是 stochastic policy。

但是 Flow Matching / Diffusion 模型通常使用 ODE: $\frac{dx}{dt}=v_\theta(x,t,c)$

给定初始 noise: $x_T$

ODE trajectory 基本是 deterministic: $x_T \rightarrow x_0$

因此不像 LLM 那样天然具有容易计算的 trajectory probability。


3. Flow-GRPO 怎么解决?

Flow-GRPO 的思路:

把 deterministic ODE 转成 stochastic SDE,使 diffusion model 可以套 GRPO / policy gradient。

SDE: $dx=f_\theta(x,t)dt+g(t)dW_t$

于是可以定义 stochastic trajectory probability,并进行 policy gradient。