跳到主内容
快讯直播
AI智模界
AI 词典

RLHF:点赞点踩如何一步步变成模型的偏好

一句话定义

RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一套让模型从人类“更喜欢哪个回答”的比较中学习,把人类偏好写进模型行为的训练方法。它不教语言,而是让模型更符合人的口味。

点赞点踩怎么变成偏好

打个比方:带实习生写周报。你不逐字改,只让他写三版,说“第二版比第一版清楚,第三版太啰嗦”。几次后,他总结出你的偏好:先结论、少形容词、数据放前面。RLHF 类似。

常见流程三步:

1. 监督微调(Supervised Fine-Tuning,SFT):用人类写好的优质回答,教模型基本格式、语气和指令遵循,像给范文。

2. 训练奖励模型(Reward Model,RM):同一问题生成多个回答,让人排序或选更好的。RM 学习预测人类偏好,而不是判断绝对事实。

3. 强化学习微调:把语言模型当策略,让它生成回答,RM 打分,再用强化学习算法(如 PPO,Proximal Policy Optimization)调参,让高分回答更可能出现。通常加 KL 惩罚,防止模型为刷分变得不像人话或偏离原有能力。

产品里的赞和踩是偏好信号之一,但单次点击噪声大,通常要聚合、去噪、抽样,才可能进入训练。不是你今天点踩,模型明天就改性格。

和相邻概念的区别

概念学习信号像什么
预训练海量文本预测下一个词大量阅读,学会说话
监督微调人类标准答案老师给范文模仿
RLHF人类对多个回答的偏好比较师傅说“这个比那个好”
提示工程输入里的指令和示例临时提要求,不改脑子

传统强化学习的奖励来自游戏分数或环境;RLHF 的奖励来自人类偏好训练出的奖励模型。DPO(Direct Preference Optimization,直接偏好优化)则尝试用偏好数据直接优化模型,省掉显式奖励模型和强化学习阶段。

对从业者和普通人的意义

从业者:偏好数据质量决定上限,标注指南、标注者多样性、一致性都很关键;还要防奖励黑客(reward hacking),即模型学会讨好奖励模型,而非真正有用或诚实。

普通人:理解 RLHF 能解释,模型很会“说人话”不代表说的都是事实。偏好训练优化的是表达和取舍,事实性还要靠数据、检索、工具和评估。模型行为以官方发布说明为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。