一句话定义:拒绝采样微调(Rejection Sampling AI 词典:Fine-tuning">Fine-tuning,RFT)是让模型对同一批问题生成很多个答案,用可靠的判据把答对的挑出来,再用这些"自己做对的样本"反过来微调模型自己。
打个比方
像学生把同一道题做一百遍,老师只留下做对的二十遍,错的扔掉,让学生照着这些解法反复模仿。练着练着,"能做对的那条路"就被加固了。"拒绝"(reject)一词来自统计学里的拒绝采样:生成一批候选,只保留符合条件的。
落到实处是三步:
1. 采样:同一道题生成多个答案,要带随机性,否则每次输出都一样,挑不出好坏。
2. 筛选:判断对错。数学题比对答案,代码跑测试,SQL 看能否执行出预期结果,结构化输出过格式校验;没有硬判据时,用奖励模型(Reward Model)或验证器(Verifier)打分。
3. 微调:把留下的答案当成标准答案,走一遍普通的监督微调。
和相邻概念的区别
| 概念 | 学习信号来自 | 特点 |
|---|---|---|
| 监督微调(SFT) | 人写的答案 | 只学正样本,数据靠人 |
| 拒绝采样微调(RFT) | 模型自己生成 + 自动判对错 | 只学正样本,数据自动产出 |
| 强化学习(RL) | 打分,可正可负 | 好答案概率拉高,坏答案压低 |
| 知识蒸馏 | 另一个更强的模型 | 跟别人学,不是跟自己学 |
还有一处容易混:拒绝采样在推理阶段也有用——一个问题多生成几个、挑最好的返回,俗称 best-of-n;只有把挑出来的答案拿去更新参数,才算 RFT。前者不改模型,后者改。
对从业者的意义
好处是省:不用人工标注新数据,也不用强化学习那一整套基础设施(奖励模型、价值模型、KL 约束调参),采样、校验、微调三步就能跑,尤其适合判对错能自动化的任务——数学、代码、形式化推理、结构化输出。
代价有两个。一是采样贵,想留够正样本就得生成很多,训练质量是拿推理算力换的;二是只学正样本容易越练越窄,同类题越来越顺手,解法多样性反而下降。常见做法是做成循环:跑一轮、更新模型、用新模型重新采样,再来一轮。
前提也很硬:判据得可信,模型也得偶尔做对。一个都答不对就没东西可挑;判对错的若还是模型自己,可能把错误一起练进去。
对普通职场人的意义
看到"模型自我提升"的说法,先问一句:谁判对错?判据能外部验证(答案、测试、规则),这招就扎实;全靠模型自己打分,就要留个心眼。它也解释了一种观感:模型在某些题型上越来越顺手,换一类新问题却未必更灵——它练的是自己已经会的那条路。
各家实现差异不小,具体细节以官方技术文档为准。
