一句话总结

HPS v2 构建了一个更大、来源更多样的人类偏好数据集 HPD v2,并基于成对偏好数据微调 CLIP,使模型能够自动评价文生图结果是否符合人类的整体偏好。


1. 研究动机

传统文生图指标各有局限:

HPS v2 希望用一个自动分数综合评价:

$$ \text{Human Preference}\approx \text{Text Alignment} + \text{Image Quality} + \text{Aesthetic Preference} $$


2. 核心方法

整体流程如下:

同一个 Prompt
    ↓
多个文生图模型生成不同图像
    ↓
人工对图像进行偏好排序
    ↓
构造成对偏好数据
    ↓
微调 CLIP
    ↓
得到 HPS v2

例如,同一 prompt 下:

Image A > Image B

模型需要学习:

$s_\theta(p,x_A)>s_\theta(p,x_B)$

其中 ($s_\theta(p,x)$) 是文本和图像特征之间的相似度。