论文信息


一句话总结

EditThinker 将传统的单轮图像编辑改造成:

生成结果 → 检查错误 → 改写指令 → 重新生成

通过多轮 Critique–Refine–Repeat,逐步提高编辑结果的指令遵循能力。


1. 研究动机

现有图像编辑模型通常一次性完成:

  1. 理解编辑指令;
  2. 判断需要修改的位置和属性;
  3. 生成最终图像。

这些过程被压缩在一次生成中,一旦出现漏改、错改或背景破坏,模型没有机会自我纠正。

作者认为,当前编辑模型更像:

Reactive Executor,而不是 Reflective Thinker。

因此,论文不继续增强 Editor 本身,而是额外引入一个负责评价和规划的 Thinker。