HPS v2 构建了一个更大、来源更多样的人类偏好数据集 HPD v2,并基于成对偏好数据微调 CLIP,使模型能够自动评价文生图结果是否符合人类的整体偏好。
传统文生图指标各有局限:
HPS v2 希望用一个自动分数综合评价:
$$ \text{Human Preference}\approx \text{Text Alignment} + \text{Image Quality} + \text{Aesthetic Preference} $$
整体流程如下:
同一个 Prompt
↓
多个文生图模型生成不同图像
↓
人工对图像进行偏好排序
↓
构造成对偏好数据
↓
微调 CLIP
↓
得到 HPS v2
例如,同一 prompt 下:
Image A > Image B
模型需要学习:
$s_\theta(p,x_A)>s_\theta(p,x_B)$
其中 ($s_\theta(p,x)$) 是文本和图像特征之间的相似度。