一句话定义:RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)指的是——不再让人类给模型的回答打分,而是交给能自动判对错的程序发奖励:对了给分,错了不给分,模型照着这个信号改自己的解题方式。
为什么“对答案”就够训出推理
打个比方。教学生写作文,得请老师逐篇读,慢,标准还飘;教学生做数学题,只要一本标准答案,对得上就是对,对不上就是错,一秒判完,还能判一千万份。RLVR 走的是后一条路。
它只挑答案能被机器验证的任务:
- 数学题:最终答案能和标准答案比对,或用形式化工具验算
- 代码题:把模型写的函数丢进单元测试,跑通才得分
- 逻辑与约束题:用规则检查器或求解器判断是否满足条件
训练时,模型对同一道题生成多个回答,程序自动判定哪些对、哪些错,做对的推理步骤被强化,做错的被压低。关键在于:被奖励的不是“人类觉得这段话顺眼”,而是“这条思路真的走到了正确答案”。这带来两个好处——信号可信,模型可以放手探索;判分近乎免费,采样规模能推得比人工标注高得多。像“同一道题采一组答案互相比”的做法(GRPO 这类组相对策略优化思路),就是在这个背景下流行起来的。
和 RLHF 差在哪
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)的奖励来自人类的偏好排序,通常先训一个奖励模型来模拟人。
| 维度 | RLHF | RLVR |
|---|---|---|
| 奖励来源 | 人类偏好 / 奖励模型打分 | 程序自动判定对错 |
| 适合任务 | 开放式、主观(写作、语气、安全) | 有确定答案(数学、代码、逻辑) |
| 信号性质 | 稠密但有噪声,能被“讨好”钻空子 | 稀疏但硬,几乎无可争辩 |
| 成本 | 人工贵,难无限扩产 | 判分近乎免费,可大规模采样 |
| 主要风险 | 奖励黑客、谄媚、风格漂移 | 覆盖面窄,没标准答案的领域用不上 |
一句话:RLHF 教模型“人喜欢什么”,RLVR 教模型“什么是对的”。
对从业者的实际意义
任务本身带天然判分器时,优先考虑 RLVR。测试用例、SQL 查询结果、形式化证明检查器、模拟器里的胜负,都是现成的判分器,比拉人标注便宜太多。但写作质量、共情分寸、审美这类没有标准答案的事,仍然得靠人类反馈或偏好优化。
两点提醒:可验证不等于好验证,出题和造测试用例本身是脏活;另外“测试通过”或“数字对上”不等于推理严谨,模型可能靠模式匹配蒙对。所以现在常见的做法是混着用——RLVR 练硬本事,RLHF 修表达和边界行为。
