跳到主内容
快讯直播
AI智模界
AI 词典

N-best 重打分:先撒网,再精挑

N-best 重打分(Rescoring)是一种两段式架构:先让一个便宜、跑得快的模型一口气生成 N 个候选答案,再让一个更强但更贵的模型给这些候选逐个打分,挑出最好的那个作为最终输出。

打个比方:海选加决赛

想象公司要招一个人。HR 先把简历快速过一遍,筛出 10 份看着还行的(这一步快、成本低、但不精细);然后让部门总监坐下来,把这 10 个人挨个面试,最终定一个(这一步慢、成本高,但判断力强)。

第一段叫候选生成(generation),第二段叫重打分(rescoring)。关键在于:总监不需要看全部 1000 份简历,只看 HR 筛出来的 10 份——省下的就是最贵的那个环节的时间。N 就是"候选数量",通常取几到几十不等。

为什么要分两段?

因为生成和判断的难度不对称。让模型从零写出一句话,比让它判断"这两句话哪句更好"要难得多。既然判断更便宜、更准,那就把大部分算力花在判断上,而不是生成上。

这在机器翻译里是经典做法:翻译模型先输出 N 个候选译文,语言模型或更强的模型再给每个候选算一个分数,选出流畅度和准确度综合最好的。语音识别里也一样,声学模型给出多个可能的转录结果,语言模型重打分后挑一个。

打分是怎么算的?

常见做法是把"生成模型给的分数"和"重打分模型给的分数"加权相加,权重大小需要调。重打分模型可以是更大的语言模型,也可以是专门训练的打分器。也有做法是直接让大模型对候选排序或投票,这时它扮演的就是裁判角色。

和相邻概念的区别

概念做什么和重打分的区别
束搜索(AI 词典:Beam Search">Beam Search)在生成过程中保留多条路径属于第一段内部,产出的就是 N-best 列表
重打分(Rescoring)对已生成的候选重新排序发生在生成之后,是第二段
投机解码(Speculative Decoding)小模型草拟、大模型验证目标也是加速,但验证的是 token 而非整句候选
集成/投票(Ensemble)多个模型各出一个结果再合并重打分是同一批候选由一个裁判评;投票是多个裁判

对实际工作的意义

一是省钱省时。把最贵的模型从"生成者"改成"裁判",调用次数下降一个数量级,质量往往还能提升。二是可解释、可干预。候选都摆在那里,你能看到模型纠结过什么;也可以在候选层面加约束,比如屏蔽敏感词、强制术语一致。三是别过度迷信。如果第一段漏掉了正确答案,第二段再强也救不回来——重打分的上限由候选列表决定,这是这套架构最需要盯住的地方。

对普通职场人来说,这个思路完全可以照搬到日常:让工具批量出草稿,自己只做挑选和打磨。人力花在判断上,通常比花在从零开始上更划算。具体模型的性能与接口细节,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。