搜索蒸馏(Search AI 词典:Distillation">Distillation)是一种训练思路:先让模型靠搜索把题做对,再把搜索过程产生的推理轨迹拿来训练模型自己,最终让模型不用搜索也能一次答对。
搜索为什么贵
树搜索(Tree Search)做的事,可以理解成下棋时的穷举推演:每步分叉出几种可能,往下展开、评估、回溯,挑出最好的一条路。搬到语言模型上,就是让它生成很多条推理路径,用验证器(Verifier)或标准答案打分,再挑最优的那条——best-of-N、思维树(Tree of Thoughts)都属于这个路子。自博弈(Self-Play)是同一思路的变体:自己出题、自己解、自己判分,不断刷出更难的样本。
搜索的答案质量高,代价是贵:一道题可能要跑几十上百次生成,延迟和算力都是普通推理的几十倍。
蒸馏:把“搜出来”变成“想出来”
打个比方:一个学徒算账,起初必须拿计算器一遍遍试;老师傅不用,看一眼就有数。搜索蒸馏就是把“用计算器试出来的过程”整理成教材让学徒反复练,练到心算。训练阶段多花点没关系,上线时便宜才重要。
流程大致三步:
1. 搜索生成:用树搜索、自博弈或大规模采样,得到一批带推理步骤的轨迹,用验证器或最终答案筛掉错的;
2. 筛出好样本:只留下能走到正确答案的推理链,必要时带上搜索得到的偏好排序,标明哪条比哪条好;
3. 训回模型:用这些轨迹做监督微调(SFT),或用偏好优化去对齐,让模型直接模仿搜索的走法;推理时关掉搜索,一次前向出答案。
和相邻概念的区别
| 概念 | 算力花在哪 | “老师”是谁 | 推理时开销 |
|---|---|---|---|
| 推理时搜索 | 每次答题 | 搜索算法+验证器 | 高 |
| 搜索蒸馏 | 训练阶段一次 | 搜索产生的轨迹 | 低 |
| 知识蒸馏 | 训练阶段 | 一个更大的模型 | 低 |
| 强化学习 | 训练阶段 | 奖励函数 | 低 |
知识蒸馏(Knowledge Distillation)是“大模型教小模型”,老师是另一个网络;搜索蒸馏是“搜索过程教模型自己”,老师是它自己搜出来的正确路径。它和强化学习(RL)也常搭着用:搜索负责探索,找到比当前策略更好的答案;蒸馏负责固化,把探索成果压进参数里。
对从业者的意义
- 成本前置:训练时贵、推理时便宜,这是能否产品化的关键取舍;
- 数据飞轮:搜索不断产出新轨迹,模型越练越强,能搜到的上限也跟着抬高;
- 主要风险是“内化不彻底”——模型只学会模仿见过的题型,换个分布就退回乱猜。验证器质量、轨迹多样性、训练配比都会影响结果,具体实现以各项目的官方页面或论文为准。
对普通人的意义
它解释了为什么一些模型“看一眼就会”,而同类题目以前要反复试。但它不等于模型凭空变聪明:搜索能探到的上限,才是蒸馏能内化的上限。
