跳到主内容
快讯直播
AI智模界
AI 词典

RLVR:靠“对答案”训出来的推理能力

一句话定义:RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)指的是——不再让人类给模型的回答打分,而是交给能自动判对错的程序发奖励:对了给分,错了不给分,模型照着这个信号改自己的解题方式。

为什么“对答案”就够训出推理

打个比方。教学生写作文,得请老师逐篇读,慢,标准还飘;教学生做数学题,只要一本标准答案,对得上就是对,对不上就是错,一秒判完,还能判一千万份。RLVR 走的是后一条路。

它只挑答案能被机器验证的任务:

  • 数学题:最终答案能和标准答案比对,或用形式化工具验算
  • 代码题:把模型写的函数丢进单元测试,跑通才得分
  • 逻辑与约束题:用规则检查器或求解器判断是否满足条件

训练时,模型对同一道题生成多个回答,程序自动判定哪些对、哪些错,做对的推理步骤被强化,做错的被压低。关键在于:被奖励的不是“人类觉得这段话顺眼”,而是“这条思路真的走到了正确答案”。这带来两个好处——信号可信,模型可以放手探索;判分近乎免费,采样规模能推得比人工标注高得多。像“同一道题采一组答案互相比”的做法(GRPO 这类组相对策略优化思路),就是在这个背景下流行起来的。

RLHF 差在哪

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)的奖励来自人类的偏好排序,通常先训一个奖励模型来模拟人。

维度RLHFRLVR
奖励来源人类偏好 / 奖励模型打分程序自动判定对错
适合任务开放式、主观(写作、语气、安全)有确定答案(数学、代码、逻辑)
信号性质稠密但有噪声,能被“讨好”钻空子稀疏但硬,几乎无可争辩
成本人工贵,难无限扩产判分近乎免费,可大规模采样
主要风险奖励黑客、谄媚、风格漂移覆盖面窄,没标准答案的领域用不上

一句话:RLHF 教模型“人喜欢什么”,RLVR 教模型“什么是对的”。

对从业者的实际意义

任务本身带天然判分器时,优先考虑 RLVR。测试用例、SQL 查询结果、形式化证明检查器、模拟器里的胜负,都是现成的判分器,比拉人标注便宜太多。但写作质量、共情分寸、审美这类没有标准答案的事,仍然得靠人类反馈或偏好优化。

两点提醒:可验证不等于好验证,出题和造测试用例本身是脏活;另外“测试通过”或“数字对上”不等于推理严谨,模型可能靠模式匹配蒙对。所以现在常见的做法是混着用——RLVR 练硬本事,RLHF 修表达和边界行为。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。