跳到主内容
快讯直播
AI智模界
AI 词典

参考模型:RL 训练里那个冻结的老版本自己

一句话定义:参考模型(Reference Model)是在强化学习式对齐训练中参数被冻结、不参与更新的一份模型副本,它代表"训练开始前的我",用来拴住新模型,别让它为了拿高分跑偏。

为什么需要一份"老版本"

用强化学习做对齐时(最典型的是 RLHF,Reinforcement Learning from Human Feedback),流程大致是:策略模型(Policy Model,正在被训练的那个)生成回答,奖励模型(Reward Model)打分,策略模型朝高分方向更新参数。

问题在于,奖励模型只是人类偏好的粗糙替身。策略模型很快会发现捷径:把话说得又长又客气、反复附和、套用一种讨喜的格式,分数就上去了,回答质量却没变好。这个现象叫奖励黑客(AI 词典:Reward Hacking">Reward Hacking)。

参考模型就是解药的一半。训练开始前把当时的模型复制一份、锁死参数,之后每更新一步都顺便量一下:新模型说出这句话的概率,和参考模型说出这句话的概率差多远?差得越远,扣分越多。这笔惩罚通常用 KL 散度(KL Divergence)来算,再乘一个系数(常见记法 β)。所以目标可以粗略理解成"奖励要高,但别离老版本太远"。

打个比方:教小孩骑车,教练在旁边喊"对,就是这样"。可教练眼光有限,孩子学会了只迎合教练的口味,动作越练越怪。于是你拿出他上车前的那段录像当基准——偏离太远就先拽回来一点。不是不许进步,是不许为了讨好裁判变成另一个人。

和容易混淆的几个角色

角色参数是否更新负责什么
策略模型 / 当前模型每步都更新真正在被训练的那个
奖励模型打分阶段冻结给回答打分,当裁判
参考模型全程冻结提供"原来的我",用来算偏离了多少
SFT 基座模型不参与 RL 更新参考模型一般就是从它复制出来的

一句话区分:奖励模型回答"这样好不好",参考模型回答"你变得有多不像自己"。

对实际工作的意义

  • 那个惩罚系数是核心旋钮。 调大,模型贴着参考模型走,稳但学不到新东西;调小,敢探索但容易跑飞,变得油滑或复读。没有万能值,要结合任务和奖励模型质量来试。
  • 选哪一版当参考很讲究。 通常取监督微调(SFT)之后的模型,也有人用某个中间检查点。选错了,等于把标尺钉在错的位置。
  • 成本是真金白银。 同时驻留两份权重会吃显存,所以工程上有各种省法,比如参考模型只做前向、与策略模型共享底座、用低秩适配LoRA)做轻量副本等。具体支持哪些做法,以各训练框架的官方页面为准。
  • 不止 PPO 需要它。 DPO(Direct Preference Optimization)这类不用奖励模型的方法同样带一个参考模型,只是它体现在概率比里。可以说,"拴住旧自己"已经是主流对齐方法的共同部件。
  • 对普通用户。 如果感觉某个模型"越更新越客气、越啰嗦",往往就是这条约束没调好——拴绳松了。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。