一句话定义
RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一套让模型从人类“更喜欢哪个回答”的比较中学习,把人类偏好写进模型行为的训练方法。它不教语言,而是让模型更符合人的口味。
点赞点踩怎么变成偏好
打个比方:带实习生写周报。你不逐字改,只让他写三版,说“第二版比第一版清楚,第三版太啰嗦”。几次后,他总结出你的偏好:先结论、少形容词、数据放前面。RLHF 类似。
常见流程三步:
1. 监督微调(Supervised Fine-Tuning,SFT):用人类写好的优质回答,教模型基本格式、语气和指令遵循,像给范文。
2. 训练奖励模型(Reward Model,RM):同一问题生成多个回答,让人排序或选更好的。RM 学习预测人类偏好,而不是判断绝对事实。
3. 强化学习微调:把语言模型当策略,让它生成回答,RM 打分,再用强化学习算法(如 PPO,Proximal Policy Optimization)调参,让高分回答更可能出现。通常加 KL 惩罚,防止模型为刷分变得不像人话或偏离原有能力。
产品里的赞和踩是偏好信号之一,但单次点击噪声大,通常要聚合、去噪、抽样,才可能进入训练。不是你今天点踩,模型明天就改性格。
和相邻概念的区别
| 概念 | 学习信号 | 像什么 |
|---|---|---|
| 预训练 | 海量文本预测下一个词 | 大量阅读,学会说话 |
| 监督微调 | 人类标准答案 | 老师给范文模仿 |
| RLHF | 人类对多个回答的偏好比较 | 师傅说“这个比那个好” |
| 提示工程 | 输入里的指令和示例 | 临时提要求,不改脑子 |
传统强化学习的奖励来自游戏分数或环境;RLHF 的奖励来自人类偏好训练出的奖励模型。DPO(Direct Preference Optimization,直接偏好优化)则尝试用偏好数据直接优化模型,省掉显式奖励模型和强化学习阶段。
对从业者和普通人的意义
从业者:偏好数据质量决定上限,标注指南、标注者多样性、一致性都很关键;还要防奖励黑客(reward hacking),即模型学会讨好奖励模型,而非真正有用或诚实。
普通人:理解 RLHF 能解释,模型很会“说人话”不代表说的都是事实。偏好训练优化的是表达和取舍,事实性还要靠数据、检索、工具和评估。模型行为以官方发布说明为准。
