ThinkGen 使用 MLLM 先推理并重写视觉生成指令,再由 DiT 生成图像。作者通过 VGI-Refine 过滤冗余 CoT,并使用 SepGRPO 分别优化 MLLM 的推理能力和 DiT 的指令执行能力。
现有 reasoning-based 图像生成方法通常针对单一任务设计,例如知识推理生成、复杂图像编辑或生成结果反思,缺少一个能够覆盖多种视觉生成任务的统一框架。
同时,完整 CoT 中包含大量中间分析和重复信息。将这些内容全部输入图像生成模型,不一定有助于生成,反而可能干扰 DiT 对最终视觉需求的理解。
ThinkGen 主要解决两个问题:
ThinkGen 由三个核心模块组成:
文本 / 参考图像
↓
MLLM:理解任务并产生 CoT
↓
VGI-Refine:**提取最终生成指令**
↓
DiT:生成或编辑图像
其中:
MLLM 的输出形式为: