一句话总结:

Unified Thinker 将“推理规划”和“图像渲染”拆分为独立的 Thinker–Generator 两个模块,并利用最终生成图像的奖励反向优化推理过程,使 CoT 从“文本上合理”转向“对生成器真正有用”。

1. 基本信息


2. 研究问题

现有推理增强图像生成方法主要有两类:

  1. 内生推理: 将理解、CoT 和图像生成统一训练在一个模型中。

    问题是推理与渲染高度耦合,训练不稳定,也可能损害原有生成质量。

  2. 外部规划器: 使用 MLLM 将复杂指令改写为详细 prompt,再交给冻结的生成模型。

    问题是 MLLM 只保证推理在文本空间中合理,但不保证生成器能够准确执行。

因此,论文关注的是:

Reasoning–Execution Gap:正确的文字推理,不一定能够转化为正确的图像。

具体表现为两种失败:


3. 核心思想