论文信息

一句话总结

统一多模态模型通常能够通过文本推理判断出“应该生成什么”,但未必能将该结论准确转化为图像。更反直觉的是,保留完整推理过程可能干扰图像生成,只输入推理得到的最终视觉描述时,效果反而最好。


1. 研究动机

统一多模态模型将文本理解、语言推理和图像生成整合在同一架构中。理论上,模型在文本推理中得到的视觉结论,应该能够被生成模块准确执行。

但现有评测通常只关注最终图像是否正确,无法区分两种失败:

  1. 模型没有推理出正确答案;
  2. 模型推理正确,但没有将答案生成到图像中。

论文因此研究 reasoning-to-pixel alignment gap:

$\text{Reasoning Correctness} \neq \text{Pixel-level Execution}$

即文本推理正确,并不代表图像生成正确。


2. UReason Benchmark

UReason 包含 2,000 个样本、5 类任务和 30 个子任务。每个问题都不会直接给出目标图像,而是要求模型先通过多步推理得到最终视觉目标,再将其生成出来。

五类任务包括: