RLVR(Reinforcement Learning from Verifiable Rewards,可验证奖励强化学习)是一种强化学习训练方法:在数学、编程等“答案有明确对错”的任务上,用自动化的验证方式(如比对最终答案、运行单元测试)来判断模型输出是否正确,并把“对不对”作为训练信号,引导模型学出更强的推理能力。
核心思想
- 传统强化学习依赖人类或奖励模型打分,成本高、主观性强
- RLVR 只用在“结果可验证”的任务上:对就是对、错就是错,无需人评
典型应用 DeepSeek-R1 在训练中大量使用 RLVR,让模型在数学、代码等任务上自发涌现出更长的推理链和更缜密的思考,是 2025 年推理模型热潮的代表性技术。
局限与趋势 RLVR 只适用于“结果可验证”的任务,主观类任务仍依赖其他对齐方法。2026 年的趋势是把 RLVR 与奖励模型、人工反馈结合,向更复杂的任务(如代码仓库级开发)扩展。