论文提出 DPO:不训练显式奖励模型,也不使用 PPO 等强化学习算法,直接通过偏好数据优化语言模型。
DPO 将“奖励模型训练 + 强化学习优化”重新参数化为一个二分类损失,直接提高 preferred response 相对于 rejected response 的概率。
核心思想:
$\text{Reward Model}+\text{RL} \quad\Longrightarrow\quad \text{Preference Classification}$
传统 RLHF 通常包含三个阶段:
传统方法的问题:
DPO 的目标是:保留 RLHF 的优化目标,但绕过显式奖励模型和强化学习过程。