一句话总结:
Unified Thinker 将“推理规划”和“图像渲染”拆分为独立的 Thinker–Generator 两个模块,并利用最终生成图像的奖励反向优化推理过程,使 CoT 从“文本上合理”转向“对生成器真正有用”。
现有推理增强图像生成方法主要有两类:
内生推理: 将理解、CoT 和图像生成统一训练在一个模型中。
问题是推理与渲染高度耦合,训练不稳定,也可能损害原有生成质量。
外部规划器: 使用 MLLM 将复杂指令改写为详细 prompt,再交给冻结的生成模型。
问题是 MLLM 只保证推理在文本空间中合理,但不保证生成器能够准确执行。
因此,论文关注的是:
Reasoning–Execution Gap:正确的文字推理,不一定能够转化为正确的图像。
具体表现为两种失败: