👍

直接偏好优化(DPO)

Direct Preference Optimization
技术原理
对齐微调

DPO(Direct Preference Optimization,直接偏好优化)是一种让模型对齐人类偏好的训练方法,由 2023 年发表的研究论文提出。与传统的 RLHF 不同,DPO 不需要先训练一个奖励模型,也不用复杂的强化学习流程,而是直接利用“哪个回答更好”的成对偏好数据来优化模型,实现更简单、更稳定。

与 RLHF 的对比

  • RLHF:训练奖励模型 → 用强化学习(PPO)迭代优化,流程长、调参难
  • DPO:跳过奖励模型,一步到位的目标函数直接更新模型,训练稳定、资源省
工作原理
  • 收集偏好数据:对同一问题,人类标注哪份回答更好
  • 建立目标:让“好回答”的概率升高、“差回答”的概率降低,且不偏离原模型太远
  • 直接梯度更新:在普通微调框架下即可完成
应用场景
  • 让聊天模型更“懂礼貌”、更贴合人类偏好
  • 让模型输出风格符合品牌调性
  • 与其他方法组合,用于微调开源模型
优点与局限 DPO 实现简单、训练稳定,因此被广泛采用;但它在部分任务上的效果上限可能不及精心调参的 RLHF。2026 年,DPO 及各种变体已是开源模型对齐的主流选择之一。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0