📊

组相对策略优化(GRPO)

Group Relative Policy Optimization
技术原理
强化学习训练

GRPO(Group Relative Policy Optimization,组相对策略优化)是一种强化学习训练算法,由 DeepSeek 团队在训练 DeepSeek-V3、DeepSeek-R1 等模型时使用并公开。它的核心思路是:让模型针对同一个问题生成一组(多个)回答,然后以这组回答内部的相对优劣作为奖励信号来更新模型,从而让模型学会“怎么做更好”。

与传统方法(PPO)的区别

  • PPO 需要训练一个单独的奖励模型来打分,并额外维护价值模型,流程复杂、算力开销大
  • GRPO 去掉了价值模型:用同一问题下的多个回答互相比较,直接用组内相对好坏更新策略,显著降低训练成本
工作方式 1. 对同一个问题让模型采样多份回答 2. 用自动校验(如 RLVR)或奖励模型给每组回答打分 3. 以组内均值为基准,计算每个回答的相对优势 4. 用这个相对优势信号强化模型

为什么重要 GRPO 让“强化学习训练推理模型”变得可行且成本可控,是 DeepSeek-R1 用相对较小的预算训练出强推理能力的关键之一,也带动了社区对推理训练方法的关注。

趋势 2026 年,GRPO 及其改进版本被国内外多家机构用于推理模型和智能体训练,成为大模型后训练环节的热门算法。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0