EditThinker 将传统的单轮图像编辑改造成:
生成结果 → 检查错误 → 改写指令 → 重新生成
通过多轮 Critique–Refine–Repeat,逐步提高编辑结果的指令遵循能力。
现有图像编辑模型通常一次性完成:
这些过程被压缩在一次生成中,一旦出现漏改、错改或背景破坏,模型没有机会自我纠正。
作者认为,当前编辑模型更像:
Reactive Executor,而不是 Reflective Thinker。
因此,论文不继续增强 Editor 本身,而是额外引入一个负责评价和规划的 Thinker。