跳到主内容
快讯直播
AI智模界
AI 词典

过程奖励模型(PRM):不只看答案,还看每一步

一句话定义:过程奖励模型(Process Reward Model,PRM)是一种对推理链条中每个中间步骤分别打分的模型,而不是等推理结束、只看最终答案对不对。

打个比方:检查一份数学作业。只看结果的老师,翻到最后一页对答案,对了打勾、错了打叉,中间十几行推导的功过一概不问。PRM 更像逐行批改的老师:第一步设未知数,对;第二步移项,错;第三步代入,对。它给出的不是一个总分,而是一串分数——每一步各有各的评价。

为什么推理模型需要它:强化学习靠奖励信号调整方向,而"只看最终答案"的信号太稀疏。一道题五步推理,只有末尾对错这一个比特的信息,中间哪一步是转折点、哪一步是蒙的,全被抹平了。更麻烦的是两种情况会被打上几乎相同的标签:前三步全对、最后抄错一个数字,和第一步就走歪、后面靠运气撞对答案。在结果奖励模型(Outcome Reward Model,ORM)眼里,后者甚至是满分。业内把这个问题叫信用分配(credit assignment):错误发生在哪一步,得有人指出来。

PRM 提供的就是这种密集信号。它既能用在训练阶段,让模型每一步都拿到反馈;也能用在推理阶段,在树搜索、多候选择优时给中间路径打分,及时剪掉明显走歪的分支。

标注是它最大的成本。逐步标注比只标最终答案贵得多。一种常见做法是:从某一步开始往下随机采样多次,统计最终答对的比例,用这个比例当作该步的分数。省人力,但噪声也更大。

和相邻概念的区别

维度结果奖励模型 ORM过程奖励模型 PRM
打分对象完整答案每一步推理
信号密度稀疏,一条轨迹一个分密集,每步一个分
标注成本较低较高
擅长场景结果容易自动验证的任务长链条、多步推理
主要风险奖励侥幸与错误过程步骤切分粒度、打分器被"讨好"

还要区分一个容易混淆的词:思维链AI 词典:Chain-of-Thought">Chain-of-Thought,CoT)是模型写出来的推理步骤,是"答卷";PRM 是给答卷逐步打分的"老师"。两者经常一起出现,但不是一回事。

实际意义:对做推理能力后训练的从业者来说,PRM 的价值在于把"这答案对不对"变成"这一步走没走对",让纠正发生在错误的那一步附近,而不是笼统地否定整条轨迹。但要提防奖励劫持(reward hacking):模型可能学会写出讨好打分器的话术,而不是真在推理。步骤怎么切、切多细,也是绕不开的工程取舍。对普通人来说,它解释了推理模型为什么要把思考过程摊开写——那些"首先、其次"不只是给人看的表演,也是为了每一步都能被检查、被纠正。具体产品与实现细节,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。