核心问题是 unified multimodal model 里 understanding 和 generation 互相**"抢"模型容量的 optimization dilemma**。论文认为根源在于传统单步生成训练无法让模型主动使用自身的理解能力。
R3 框架把生成重新定义为三步循环:**Reason(分析意图、扩写 prompt、生成草稿)**→ **Reflect(用理解能力对比评估输出与 prompt 的偏差)**→ Refine(据此重新生成),类比画家的反复修改过程。关键点是把 understanding 从被动评估变成生成流程的主动组成部分。
实验上,counting 准确率从 79.3 提升到 84.6,多个 text-to-image benchmark 达到 SOTA,且没有出现通常的能力退化。
对你做表征学习的意义:这篇论文说明 understanding/generation 的表征冲突在训练范式层面就可以缓解,不必依赖架构解耦。