一句话定义:参考模型(Reference Model)是在强化学习式对齐训练中参数被冻结、不参与更新的一份模型副本,它代表"训练开始前的我",用来拴住新模型,别让它为了拿高分跑偏。
为什么需要一份"老版本"
用强化学习做对齐时(最典型的是 RLHF,Reinforcement Learning from Human Feedback),流程大致是:策略模型(Policy Model,正在被训练的那个)生成回答,奖励模型(Reward Model)打分,策略模型朝高分方向更新参数。
问题在于,奖励模型只是人类偏好的粗糙替身。策略模型很快会发现捷径:把话说得又长又客气、反复附和、套用一种讨喜的格式,分数就上去了,回答质量却没变好。这个现象叫奖励黑客(AI 词典:Reward Hacking">Reward Hacking)。
参考模型就是解药的一半。训练开始前把当时的模型复制一份、锁死参数,之后每更新一步都顺便量一下:新模型说出这句话的概率,和参考模型说出这句话的概率差多远?差得越远,扣分越多。这笔惩罚通常用 KL 散度(KL Divergence)来算,再乘一个系数(常见记法 β)。所以目标可以粗略理解成"奖励要高,但别离老版本太远"。
打个比方:教小孩骑车,教练在旁边喊"对,就是这样"。可教练眼光有限,孩子学会了只迎合教练的口味,动作越练越怪。于是你拿出他上车前的那段录像当基准——偏离太远就先拽回来一点。不是不许进步,是不许为了讨好裁判变成另一个人。
和容易混淆的几个角色
| 角色 | 参数是否更新 | 负责什么 |
|---|---|---|
| 策略模型 / 当前模型 | 每步都更新 | 真正在被训练的那个 |
| 奖励模型 | 打分阶段冻结 | 给回答打分,当裁判 |
| 参考模型 | 全程冻结 | 提供"原来的我",用来算偏离了多少 |
| SFT 基座模型 | 不参与 RL 更新 | 参考模型一般就是从它复制出来的 |
一句话区分:奖励模型回答"这样好不好",参考模型回答"你变得有多不像自己"。
对实际工作的意义
- 那个惩罚系数是核心旋钮。 调大,模型贴着参考模型走,稳但学不到新东西;调小,敢探索但容易跑飞,变得油滑或复读。没有万能值,要结合任务和奖励模型质量来试。
- 选哪一版当参考很讲究。 通常取监督微调(SFT)之后的模型,也有人用某个中间检查点。选错了,等于把标尺钉在错的位置。
- 成本是真金白银。 同时驻留两份权重会吃显存,所以工程上有各种省法,比如参考模型只做前向、与策略模型共享底座、用低秩适配(LoRA)做轻量副本等。具体支持哪些做法,以各训练框架的官方页面为准。
- 不止 PPO 需要它。 DPO(Direct Preference Optimization)这类不用奖励模型的方法同样带一个参考模型,只是它体现在概率比里。可以说,"拴住旧自己"已经是主流对齐方法的共同部件。
- 对普通用户。 如果感觉某个模型"越更新越客气、越啰嗦",往往就是这条约束没调好——拴绳松了。
