GRPO(Group Relative Policy Optimization,组相对策略优化)是一种强化学习训练算法,由 DeepSeek 团队在训练 DeepSeek-V3、DeepSeek-R1 等模型时使用并公开。它的核心思路是:让模型针对同一个问题生成一组(多个)回答,然后以这组回答内部的相对优劣作为奖励信号来更新模型,从而让模型学会“怎么做更好”。
与传统方法(PPO)的区别
- PPO 需要训练一个单独的奖励模型来打分,并额外维护价值模型,流程复杂、算力开销大
- GRPO 去掉了价值模型:用同一问题下的多个回答互相比较,直接用组内相对好坏更新策略,显著降低训练成本
为什么重要 GRPO 让“强化学习训练推理模型”变得可行且成本可控,是 DeepSeek-R1 用相对较小的预算训练出强推理能力的关键之一,也带动了社区对推理训练方法的关注。
趋势 2026 年,GRPO 及其改进版本被国内外多家机构用于推理模型和智能体训练,成为大模型后训练环节的热门算法。