跳到主内容
快讯直播
AI智模界
AI 词典

GRPO:不请「裁判」的强化学习算法

一句话定义

GRPO(Group Relative Policy Optimization,组相对策略优化)是一种强化学习算法。它去掉了 PPO 里那个需要单独训练的价值模型(value model,也叫 critic),改用「同一道题多答几遍、组内互相比」的方式估计每个回答的好坏,常用于训练推理模型。

PPO 的「裁判」很贵

用强化学习调教大模型时,主流做法是 PPO(Proximal Policy Optimization,近端策略优化)。它需要一个额外的价值模型来回答一个问题:「在这个提示词下,模型平均能拿多少分?」这个分数叫基线(baseline)。有了基线,才能算出某个回答到底「比预期好多少」,也就是优势(advantage)——比预期好就鼓励,比预期差就抑制。

麻烦在于,价值模型往往和策略模型体量相当,训练时要多占一份显存、多跑一遍前向和反向。模型越大,这份开销越肉疼,而且价值模型自己未必估得准。

GRPO 的解法:拿同组同学当参照

GRPO 的思路很直接:既然基线估不准,那就不估了,直接用同一组样本的平均分当基线。

具体做法是:对同一个提示词,让模型一次采样 G 条回答(比如 8 条、16 条),逐条打分;然后把每条回答的得分在这一组内部做标准化,得到相对优势——形式大致是「(本条得分 − 组内平均分)÷ 组内标准差」。之后照旧用 PPO 式的裁剪(clip)目标限制每次更新的幅度,并加一项 KL(Kullback-Leibler)散度惩罚,防止模型跑得太偏、偏离原来的分布。

打个比方:老师出了一道题,叫 8 个学生各写一份答案,不预先划「及格线」,而是直接横向比较——你比这 8 个人的平均分高多少、高出几个身位,就说明你这份答案相对更值得表扬。这样就省掉了另请一位「评分基准老师」的成本。

和相邻概念的区别

方法需要价值模型数据从哪来典型场景
PPO需要在线采样通用 RLHF
GRPO不需要在线采样,一问多答推理模型的强化学习
DPO不需要离线偏好对对齐微调,无在线探索

DPO(Direct Preference Optimization)虽然也不需要价值模型,但它是离线方法,只用现成的「哪个回答更好」的对比数据;GRPO 是在线方法,模型要不断自己生成新回答、接受打分,因此有机会靠探索撞出新解法。

对从业者的意义

  • 省显存、省工程复杂度:不用再维护一个和主模型同量级的价值网络,训练链路更短,对显存紧张的场景尤其友好。
  • 奖励可以很「规则」:推理任务的正确性常常能自动验证(答案对不对、单元测试过不过),配上 GRPO 后连奖励模型都能省,直接用规则打分即可。
  • 代价也很真实:一次要生成多条回答,采样成本上升;如果一组里全对或全错,组内得分没有差异,优势信号就退化了,实践中常需要过滤这类样本,或调整采样与打分方式。后续不少工作也是围绕这些点做改良。
  • 想落到具体实现,采样条数、KL 系数、学习率这些设置以官方论文和代码页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。