会议: ICLR 2026 Poster
论文类型: 文生图数据集与评测基准
核心资源: FLUX-Reason-6M 数据集、PRISM-Bench、PRISM-Bench-ZH
论文构建了包含 600 万张合成图像、约 2000 万条中英双语描述的 FLUX-Reason-6M,并用 Generation Chain-of-Thought(GCoT)描述图像的语义、布局、风格和情感构成;同时提出覆盖七个维度的 PRISM-Bench,用 VLM 评估图像的指令对齐程度和美学质量。
作者认为,开源文生图模型落后于闭源模型的一个重要原因是缺少:
传统数据集通常只有简单的 image-caption pair,只描述“图中有什么”,缺少对空间布局、视觉风格、情绪表达和创作逻辑的结构化描述。
已有 reasoning-oriented 数据集如 GoT,主要强调 bounding box 和布局规划,覆盖的生成维度相对有限。现有评测则常依赖 CLIP Score 或检测器,容易饱和,也难以评估想象力、情感和长文本指令遵循。
FLUX-Reason-6M 包含: