DDA-Thinker 不训练图像生成模型,而是冻结 Editor,仅通过同时评价“编辑计划是否正确”和“最终图像是否正确”的双原子奖励,使用 GRPO 优化负责推理与规划的 Thinker。
其核心不是让模型生成更长的 CoT,而是让 Thinker 输出更正确、更具体、且 Editor 能够执行的编辑计划。(arXiv)
现有 reasoning-driven image editing 通常存在两个问题。
当最终图像错误时,无法确定究竟是:
DDA-Thinker 因此固定 Editor,只优化 Thinker,将问题转化为:
在生成器能力固定的情况下,单纯提升编辑计划质量,能够带来多大收益?
这种解耦设定主要用于获得更清晰的 credit assignment,而不是声称其一定优于联合训练。