一句话总结:

ThinkRL-Edit 不再只在图像去噪轨迹中进行 RL 探索,而是把 CoT 规划与反思也纳入在线采样和策略优化,并用最终编辑结果的多维奖励同时训练理解模块与生成模块。

1. 基本信息


2. 研究动机

现有图像生成 RL 通常只探索不同的去噪轨迹:

$\text{同一条件} \rightarrow \text{不同噪声轨迹} \rightarrow \text{不同图像}$

这可以提升美学、文字渲染和图文对齐,但对于 reasoning-centric editing,真正决定结果的往往是:

模型在生成之前,是否正确理解了图像、指令和隐含条件。

论文总结了三个问题:

  1. Reasoning exploration 不足

    FlowGRPO 等方法只探索生成随机性,没有探索不同语义解释和推理路径。

  2. 多奖励加权存在偏差

    图像编辑需要同时优化指令遵循、内容保持和图像质量,简单加权容易被某个数值较高的奖励主导。

  3. VLM 打分不稳定

    让 VLM 直接输出 1–5 分时,同一结果重复评估可能得到不同分数,复杂推理任务中尤其明显。


3. 核心框架

ThinkRL-Edit 将策略模型拆成两个部分: