🎯

可验证奖励强化学习(RLVR)

RLVR (Reinforcement Learning from Verifiable Rewards)
技术原理
强化学习推理

RLVR(Reinforcement Learning from Verifiable Rewards,可验证奖励强化学习)是一种强化学习训练方法:在数学、编程等“答案有明确对错”的任务上,用自动化的验证方式(如比对最终答案、运行单元测试)来判断模型输出是否正确,并把“对不对”作为训练信号,引导模型学出更强的推理能力。

核心思想

  • 传统强化学习依赖人类或奖励模型打分,成本高、主观性强
  • RLVR 只用在“结果可验证”的任务上:对就是对、错就是错,无需人评
工作方式 1. 让模型针对数学题或编程题生成解答 2. 用答案比对、单元测试等方式自动判定对错 3. 正确的回答给正奖励,错误的给负奖励 4. 用这些信号强化模型,让“想对了”的行为被保留下来

典型应用 DeepSeek-R1 在训练中大量使用 RLVR,让模型在数学、代码等任务上自发涌现出更长的推理链和更缜密的思考,是 2025 年推理模型热潮的代表性技术。

局限与趋势 RLVR 只适用于“结果可验证”的任务,主观类任务仍依赖其他对齐方法。2026 年的趋势是把 RLVR 与奖励模型、人工反馈结合,向更复杂的任务(如代码仓库级开发)扩展。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0