DPO(Direct Preference Optimization,直接偏好优化)是一种让模型对齐人类偏好的训练方法,由 2023 年发表的研究论文提出。与传统的 RLHF 不同,DPO 不需要先训练一个奖励模型,也不用复杂的强化学习流程,而是直接利用“哪个回答更好”的成对偏好数据来优化模型,实现更简单、更稳定。
与 RLHF 的对比
- RLHF:训练奖励模型 → 用强化学习(PPO)迭代优化,流程长、调参难
- DPO:跳过奖励模型,一步到位的目标函数直接更新模型,训练稳定、资源省
- 收集偏好数据:对同一问题,人类标注哪份回答更好
- 建立目标:让“好回答”的概率升高、“差回答”的概率降低,且不偏离原模型太远
- 直接梯度更新:在普通微调框架下即可完成
- 让聊天模型更“懂礼貌”、更贴合人类偏好
- 让模型输出风格符合品牌调性
- 与其他方法组合,用于微调开源模型