论文提出 DPO:不训练显式奖励模型,也不使用 PPO 等强化学习算法,直接通过偏好数据优化语言模型。


1. 一句话总结

DPO 将“奖励模型训练 + 强化学习优化”重新参数化为一个二分类损失,直接提高 preferred response 相对于 rejected response 的概率。

核心思想:

$\text{Reward Model}+\text{RL} \quad\Longrightarrow\quad \text{Preference Classification}$


2. 研究动机

传统 RLHF 通常包含三个阶段:

  1. SFT:使用高质量回答监督微调模型。
  2. Reward Modeling:利用偏好对训练奖励模型。
  3. RL Fine-tuning:通过 PPO 最大化奖励,同时限制模型不要偏离 SFT 模型。

传统方法的问题:

DPO 的目标是:保留 RLHF 的优化目标,但绕过显式奖励模型和强化学习过程。


3. 偏好数据形式