Paper: TempFlow-GRPO: When Timing Matters for GRPO in Flow Models

Venue: ICLR 2026

核心问题: 普通 Flow-GRPO 对不同 timestep 采用近似统一的 credit assignment,但 Flow Model 在不同时间阶段承担的生成任务并不相同。TempFlow-GRPO 引入 Trajectory Branching + Noise-aware Weighting + Seed Group,让 GRPO 感知生成过程中的 temporal structure。 (ICLR 会议录)

知识点:不同 timestep 的梯度尺度和探索能力不一致,所以 uniform timestep sampling 会产生 temporal imbalance

  1. shift > 1 会造成 timestep 分布不均匀,时间间隔 $\Delta t$ 在噪声端更小,越靠近干净图像,$\Delta t$ 越大。

    image.png

  2. SDE 在 timestep k 的注入随机噪声的程度,代表随机探索的程度,规律:k越大,探索幅度越大,k越小,探索幅度越小, 因此按噪声水平重加权损失函数

image.png

  1. 噪声越大,单次随机变化越大;但因为 transition distribution 本身更“宽”,同样的 displacement 对 log-probability 的敏感程度反而降低。
  2. Flow-GRPO 在均匀 timestep 处理下,由于不同 timestep 的 policy-gradient scale 本身不一样,可能导致有效的梯度更新更多集中在某些 timestep;如果这些 timestep 对应生成后期,就会表现为更偏向细节/纹理优化。

$σ_tΔ_t$ 噪声尺度, 描述“这一步能探索多远”;

$\frac{\sqrt{\Delta t}}{\sigma_t}$ Policy Gradient 尺度, 描述“这一步的 log-policy gradient 有多大”。

  1. 无重加权”设置下,每个时间步的模型梯度对最终奖励梯度的贡献表现出高度 不平衡。这种非均匀性系统性地导致早期降噪步骤中模型进行广泛、结构探索的贡献显著小于后期步骤专注于细粒度优化的贡献。通过采用我们提出的噪声感知策略重加权,这一问题得到了显著缓解,因为比例项简化为与步长 ∆k 直接成比例。此外,当流偏移设置为 1 时, 我们的方法实现了完美的均衡:它确保每个时间步的梯度贡献完全相等,从而在整个生成轨迹上完全平衡了这一效

1. 背景:Flow-GRPO 的问题

Flow-GRPO 的基本流程:

Prompt
  ↓
SDE Rollout
  ↓
xT → xT-1 → ... → x0
  ↓
生成 Image
  ↓
Reward
  ↓
GRPO
  ↓
更新 Model

问题在于:

最终只有一个 terminal reward,但生成过程包含很多 timestep。( sparse terminal rewards with uniform credit assignment)

例如:

t = 0.9 → 决定整体结构
t = 0.6 → 决定物体关系
t = 0.3 → 开始细化
t = 0.1 → 纹理 / 局部细节

这些 timestep 对最终结果的重要程度不同。

但普通 GRPO 的 credit assignment 容易近似成:

$A_t \approx A$

也就是:

整条 trajectory 获得的 reward 被比较平均地归因到各个 timestep。

TempFlow-GRPO 认为这是 Flow RL 中一个重要问题:temporal uniformity assumption。


image.png

2. 核心 Insight:Timing Matters

TempFlow-GRPO 的核心观点: