统一多模态模型通常能够通过文本推理判断出“应该生成什么”,但未必能将该结论准确转化为图像。更反直觉的是,保留完整推理过程可能干扰图像生成,只输入推理得到的最终视觉描述时,效果反而最好。
统一多模态模型将文本理解、语言推理和图像生成整合在同一架构中。理论上,模型在文本推理中得到的视觉结论,应该能够被生成模块准确执行。
但现有评测通常只关注最终图像是否正确,无法区分两种失败:
论文因此研究 reasoning-to-pixel alignment gap:
$\text{Reasoning Correctness} \neq \text{Pixel-level Execution}$
即文本推理正确,并不代表图像生成正确。
UReason 包含 2,000 个样本、5 类任务和 30 个子任务。每个问题都不会直接给出目标图像,而是要求模型先通过多步推理得到最终视觉目标,再将其生成出来。
五类任务包括: