一句话定义:过程奖励模型(Process Reward Model,PRM)是一种对推理链条中每个中间步骤分别打分的模型,而不是等推理结束、只看最终答案对不对。
打个比方:检查一份数学作业。只看结果的老师,翻到最后一页对答案,对了打勾、错了打叉,中间十几行推导的功过一概不问。PRM 更像逐行批改的老师:第一步设未知数,对;第二步移项,错;第三步代入,对。它给出的不是一个总分,而是一串分数——每一步各有各的评价。
为什么推理模型需要它:强化学习靠奖励信号调整方向,而"只看最终答案"的信号太稀疏。一道题五步推理,只有末尾对错这一个比特的信息,中间哪一步是转折点、哪一步是蒙的,全被抹平了。更麻烦的是两种情况会被打上几乎相同的标签:前三步全对、最后抄错一个数字,和第一步就走歪、后面靠运气撞对答案。在结果奖励模型(Outcome Reward Model,ORM)眼里,后者甚至是满分。业内把这个问题叫信用分配(credit assignment):错误发生在哪一步,得有人指出来。
PRM 提供的就是这种密集信号。它既能用在训练阶段,让模型每一步都拿到反馈;也能用在推理阶段,在树搜索、多候选择优时给中间路径打分,及时剪掉明显走歪的分支。
标注是它最大的成本。逐步标注比只标最终答案贵得多。一种常见做法是:从某一步开始往下随机采样多次,统计最终答对的比例,用这个比例当作该步的分数。省人力,但噪声也更大。
和相邻概念的区别:
| 维度 | 结果奖励模型 ORM | 过程奖励模型 PRM |
|---|---|---|
| 打分对象 | 完整答案 | 每一步推理 |
| 信号密度 | 稀疏,一条轨迹一个分 | 密集,每步一个分 |
| 标注成本 | 较低 | 较高 |
| 擅长场景 | 结果容易自动验证的任务 | 长链条、多步推理 |
| 主要风险 | 奖励侥幸与错误过程 | 步骤切分粒度、打分器被"讨好" |
还要区分一个容易混淆的词:思维链(AI 词典:Chain-of-Thought">Chain-of-Thought,CoT)是模型写出来的推理步骤,是"答卷";PRM 是给答卷逐步打分的"老师"。两者经常一起出现,但不是一回事。
实际意义:对做推理能力后训练的从业者来说,PRM 的价值在于把"这答案对不对"变成"这一步走没走对",让纠正发生在错误的那一步附近,而不是笼统地否定整条轨迹。但要提防奖励劫持(reward hacking):模型可能学会写出讨好打分器的话术,而不是真在推理。步骤怎么切、切多细,也是绕不开的工程取舍。对普通人来说,它解释了推理模型为什么要把思考过程摊开写——那些"首先、其次"不只是给人看的表演,也是为了每一步都能被检查、被纠正。具体产品与实现细节,以官方页面为准。
