图像生成能力不仅取决于模型、数据和算力,还取决于文本条件中包含多少与图像对应、可定位且无歧义的视觉信息。
论文发现,单纯增加自然语言 Prompt 的长度不能稳定改善生成;而增加物体、布局、属性和关系等结构化信息,可以持续降低 diffusion loss,并呈现明显的经验 scaling law。
现有文生图模型在多物体组合、空间关系、属性绑定和世界知识生成上仍然容易出错。
作者认为,一个重要原因是训练 caption 没有完整描述图像内容。例如,图像中可能包含多个物体的位置、遮挡、材质和交互关系,但 caption 只描述了主要主体。
这些没有被 caption 暴露的视觉信息虽然存在于图像中,却没有形成明确的 text-to-image 条件监督。
因此,论文提出:
$\text{Prompt Length} \neq \text{Visual Information}.$
文本更长,不代表它包含了更多可供生成模型利用的视觉信号。
作者使用相同的 Qwen-Image backbone,对同一张参考图像进行条件重建。