核心结论

HPSv3 通过更全面的偏好数据、更强的视觉语言模型和不确定性感知排序损失,提升了图像生成结果与人类偏好的一致性。


1. 论文要解决什么问题?

现有图像偏好模型主要存在三个问题:

HPSv3 分别从数据、模型和损失函数三个方面进行改进。


2. HPDv3:更广覆盖的偏好数据

HPDv3 包含:

主要数据来源:

  1. 使用 FLUX、SD3、Kolors 等新模型重新生成 HPDv2 Prompt;
  2. 收集高质量真实图像,与生成图像进行比较;
  3. 使用 Midjourney 用户真实选择作为偏好标签;
  4. 混合 Pick-a-Pic、ImageReward 和筛选后的 HPDv2 数据。

核心作用:让偏好模型同时学会区分低质量结果和先进模型之间的细微差异。