一句话总结

ThinkGen 使用 MLLM 先推理并重写视觉生成指令,再由 DiT 生成图像。作者通过 VGI-Refine 过滤冗余 CoT,并使用 SepGRPO 分别优化 MLLM 的推理能力和 DiT 的指令执行能力。


1. 研究动机

现有 reasoning-based 图像生成方法通常针对单一任务设计,例如知识推理生成、复杂图像编辑或生成结果反思,缺少一个能够覆盖多种视觉生成任务的统一框架。

同时,完整 CoT 中包含大量中间分析和重复信息。将这些内容全部输入图像生成模型,不一定有助于生成,反而可能干扰 DiT 对最终视觉需求的理解。

ThinkGen 主要解决两个问题:

  1. 如何让模型根据任务进行有效思考;
  2. 如何把推理结果转化为适合图像生成的条件。

2. 整体框架

ThinkGen 由三个核心模块组成:

文本 / 参考图像
        ↓
MLLM:理解任务并产生 CoT
        ↓
VGI-Refine:**提取最终生成指令**
        ↓
DiT:生成或编辑图像

其中:


3. VGI-Refine

MLLM 的输出形式为: