1. 基本信息


2. 一句话总结

DDA-Thinker 不训练图像生成模型,而是冻结 Editor,仅通过同时评价“编辑计划是否正确”和“最终图像是否正确”的双原子奖励,使用 GRPO 优化负责推理与规划的 Thinker。

其核心不是让模型生成更长的 CoT,而是让 Thinker 输出更正确、更具体、且 Editor 能够执行的编辑计划。(arXiv)


3. 研究动机

现有 reasoning-driven image editing 通常存在两个问题。

3.1 Thinker 与 Editor 联合优化,错误难以归因

当最终图像错误时,无法确定究竟是:

DDA-Thinker 因此固定 Editor,只优化 Thinker,将问题转化为:

在生成器能力固定的情况下,单纯提升编辑计划质量,能够带来多大收益?

这种解耦设定主要用于获得更清晰的 credit assignment,而不是声称其一定优于联合训练。

3.2 仅使用图像奖励存在“认知盲区”