一句话总结:
ThinkRL-Edit 不再只在图像去噪轨迹中进行 RL 探索,而是把 CoT 规划与反思也纳入在线采样和策略优化,并用最终编辑结果的多维奖励同时训练理解模块与生成模块。
现有图像生成 RL 通常只探索不同的去噪轨迹:
$\text{同一条件} \rightarrow \text{不同噪声轨迹} \rightarrow \text{不同图像}$
这可以提升美学、文字渲染和图文对齐,但对于 reasoning-centric editing,真正决定结果的往往是:
模型在生成之前,是否正确理解了图像、指令和隐含条件。
论文总结了三个问题:
Reasoning exploration 不足
FlowGRPO 等方法只探索生成随机性,没有探索不同语义解释和推理路径。
多奖励加权存在偏差
图像编辑需要同时优化指令遵循、内容保持和图像质量,简单加权容易被某个数值较高的奖励主导。
VLM 打分不稳定
让 VLM 直接输出 1–5 分时,同一结果重复评估可能得到不同分数,复杂推理任务中尤其明显。
ThinkRL-Edit 将策略模型拆成两个部分: