一句话定义:SFT(Supervised Fine-Tuning,监督微调)是拿人工写好的“问题—标准答案”,让模型照着模仿;RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是让模型对同一个问题多答几版,由人排序打分,再据此把模型往人更偏好的方向推。
为什么需要这两步
模型的第一阶段是预训练(Pre-training):读海量文本,学会“下一个词大概是什么”。这时它知识面很广,却像个只会接话的话痨——你问它问题,它可能顺着你的句子往下编,而不是认真回答。要让它听话,通常还要再加两步。
SFT 像岗前培训:给模型看成千上万条示范,输入是用户提问,输出是人工写好的理想回答,模型学着把差距压小。它学到的主要是“按指令作答”的格式、语气和套路,本质是模仿。
RLHF 像上岗后收集客户评分:先让模型对同一个问题生成多个回答,标注员按有用、真实、无害等标准排序;再用这些排序数据训练一个奖励模型(Reward Model),让它学会代替人类打分;最后用强化学习(常见做法是 PPO)调整模型,让它生成更可能拿高分的回答。模型不是被直接告知“正确答案”,而是被引导去猜“人更喜欢哪种答法”。
和相邻概念的区别
预训练学的是“语言与世界知识”,SFT 学的是“照着范例答”,RLHF 学的是“哪种回答更好”。三者是接力关系,不是三选一。
| 对比项 | SFT | RLHF |
|---|---|---|
| 训练信号 | 人工撰写的标准答案 | 人类对多个回答的排序偏好 |
| 模型在学 | 模仿“这样答是对的” | 优化“人更偏好哪种答法” |
| 擅长 | 指令跟随、输出格式 | 语气分寸、边界感、拒答方式 |
| 常见毛病 | 没示范过的场景容易僵化 | 可能学会讨好、变得啰嗦 |
对从业者和普通人的意义
对从业者:SFT 数据通常决定下限,偏好数据决定上限。示范要覆盖真实使用场景,偏好标注标准要写清楚,否则模型学到的是标注员的口味而不是用户的。上线前还要留出与训练数据不重叠的评测集。RLHF 之后也有 DPO 等更轻量的偏好优化做法,思路相近;具体某个模型用了哪套流程,以官方页面为准。
对普通人:模型显得礼貌、克制、会拒绝,多半不是它“懂事”,而是这两步训练出来的习惯。所以它答得含糊时,不妨明确要求分步骤、给例子、换角度;它一味顺从时,也别把“听话”直接当成“正确”。
