Paper: TempFlow-GRPO: When Timing Matters for GRPO in Flow Models
Venue: ICLR 2026
核心问题: 普通 Flow-GRPO 对不同 timestep 采用近似统一的 credit assignment,但 Flow Model 在不同时间阶段承担的生成任务并不相同。TempFlow-GRPO 引入 Trajectory Branching + Noise-aware Weighting + Seed Group,让 GRPO 感知生成过程中的 temporal structure。 (ICLR 会议录)
知识点:不同 timestep 的梯度尺度和探索能力不一致,所以 uniform timestep sampling 会产生 temporal imbalance
shift > 1 会造成 timestep 分布不均匀,时间间隔 $\Delta t$ 在噪声端更小,越靠近干净图像,$\Delta t$ 越大。
SDE 在 timestep k 的注入随机噪声的程度,代表随机探索的程度,规律:k越大,探索幅度越大,k越小,探索幅度越小, 因此按噪声水平重加权损失函数
- 噪声越大,单次随机变化越大;但因为 transition distribution 本身更“宽”,同样的 displacement 对 log-probability 的敏感程度反而降低。
- Flow-GRPO 在均匀 timestep 处理下,由于不同 timestep 的 policy-gradient scale 本身不一样,可能导致有效的梯度更新更多集中在某些 timestep;如果这些 timestep 对应生成后期,就会表现为更偏向细节/纹理优化。
$σ_tΔ_t$ 噪声尺度, 描述“这一步能探索多远”;
$\frac{\sqrt{\Delta t}}{\sigma_t}$ Policy Gradient 尺度, 描述“这一步的 log-policy gradient 有多大”。
- 无重加权”设置下,每个时间步的模型梯度对最终奖励梯度的贡献表现出高度 不平衡。这种非均匀性系统性地导致早期降噪步骤中模型进行广泛、结构探索的贡献显著小于后期步骤专注于细粒度优化的贡献。通过采用我们提出的噪声感知策略重加权,这一问题得到了显著缓解,因为比例项简化为与步长 ∆k 直接成比例。此外,当流偏移设置为 1 时, 我们的方法实现了完美的均衡:它确保每个时间步的梯度贡献完全相等,从而在整个生成轨迹上完全平衡了这一效
Flow-GRPO 的基本流程:
Prompt
↓
SDE Rollout
↓
xT → xT-1 → ... → x0
↓
生成 Image
↓
Reward
↓
GRPO
↓
更新 Model
问题在于:
最终只有一个 terminal reward,但生成过程包含很多 timestep。( sparse terminal rewards with uniform credit assignment)
例如:
t = 0.9 → 决定整体结构
t = 0.6 → 决定物体关系
t = 0.3 → 开始细化
t = 0.1 → 纹理 / 局部细节
这些 timestep 对最终结果的重要程度不同。
但普通 GRPO 的 credit assignment 容易近似成:
$A_t \approx A$
也就是:
整条 trajectory 获得的 reward 被比较平均地归因到各个 timestep。
TempFlow-GRPO 认为这是 Flow RL 中一个重要问题:temporal uniformity assumption。

TempFlow-GRPO 的核心观点: