奖励模型(Reward Model)是一个用于“打分”的辅助模型:输入一个问题和一个回答,它输出一个分数,表示“这个回答有多好、多符合人类偏好”。在 RLHF 等对齐训练流程中,奖励模型充当“裁判”,用分数指导主模型优化方向,让主模型学会生成人类更喜欢的内容。
为什么需要它
- 人类逐条评分太贵、太慢,无法支撑模型上百万次试错
- 奖励模型是对人类偏好的一次“数学化编码”:人类评过的数据 → 训练出自动打分的裁判
- 收集偏好数据:人类对同一问题的多个回答做排序(哪个更好)
- 学习打分:训练模型学会预测“人类更可能偏好哪个回答”
- 输出信号:训练时对高分回答给予正奖励、低分回答给予负奖励
- RLHF 三件套之一:监督微调 → 奖励模型 → 强化学习优化
- 强化学习阶段:主模型生成回答,奖励模型打分,再优化主模型
- 奖励模型“分数高”不代表“真实好用”,可能被钻空子(奖励欺骗)
- 2026 年的趋势:用可自动验证的奖励(RLVR)替代部分人工打分,以及让大模型自身充当“AI 裁判”来生成训练信号,减少对人工标注的依赖。