论文信息
- 作者:Sen Ye、Mengde Xu、Shuyang Gu、Di He、Liwei Wang、Han Hu
- 机构:北京大学、腾讯
- 时间:2026 年 2 月
- 基础模型:BAGEL
- 核心方法:Reason–Reflect–Refine,简称 R3
- 训练方式:Tree-RL;文本部分使用 GRPO,图像扩散部分使用 MixGRPO
- 代码:已开源
一句话总结
论文认为,统一多模态模型中理解与生成相互冲突,是因为两者通常被当作两个独立任务优化。
R3 将单步图像生成改造成:
$\text{Reason} \rightarrow \text{Generate} \rightarrow \text{Reflect} \rightarrow \text{Refine}$
让模型必须先理解和检查自己的生成结果,才能继续生成,从而将理解能力嵌入生成过程。
1. 研究动机
统一多模态模型希望同时具备:
- Understanding:VQA、计数、空间关系判断和图文匹配;
- Generation:文本生成图像、图像编辑和视觉内容创作。
但作者在 BAGEL 上发现: