跳到主内容
快讯直播
AI智模界
AI 词典

典型采样:按信息量挑词,让模型少说胡话

一句话定义

典型采样(Typical Sampling)是一种文本解码策略:它不选概率最高的词,也不完全按概率随机抽,而是优先选那些“信息量接近当下平均水平”的词。

原理:挑“正常”的词

语言模型每生成一个词,都会给出词表里每个候选词的概率。概率最高的一小撮词往往最稳、最没新意,重复起来像复读机;概率极低的词基本是噪声,抽到就胡说。信息论里有个概念叫典型集(Typical Set):一段随机序列的平均信息量,通常接近分布的熵(Entropy),而不会落到极端。典型采样把这个直觉搬到单个词上——先算出当前概率分布的熵,再算每个候选词的信息量 −log p,谁离这个平均信息量最近,谁就最“典型”,优先进入候选池。

打个比方:公司团建点菜。菜单上最热门的永远是那几道,吃腻了;闭眼乱点,可能点到没人敢下筷的。典型采样是挑那些“出现在菜单上、评价正常、不算最火也不算最冷门”的菜——既新鲜,又不会翻车。

和相邻方法的区别

方法挑选依据典型表现
贪心/束搜索(Greedy / AI 词典:Beam Search">Beam Search)概率最高稳定但重复、呆板
纯随机采样按原始概率抽多样但容易跑偏
Top-k 采样固定取前 k 个k 写死,不适应分布形状
Top-p核采样,Nucleus Sampling)累积概率达到 p候选数量动态,长尾仍可能混入
温度Temperature缩放整个分布只调陡峭程度,不负责筛选
典型采样信息量接近期望熵兼顾多样性与合理性

Top-p 会把累积概率边界内的所有词都收进来,包括一些概率已经低到离谱的词;典型采样则明确把“信息量离群”的词踢出去,这正是它减少胡言乱语的关键。

对从业者与普通人的意义

  • 做开放生成、创意写作、对话时,典型采样在“不重复”和“不胡说”之间找了第三条路。想要稳一点,可以和其他截断策略配合;想要野一点,也不至于直接崩成乱码。
  • 各家框架对它的参数命名、默认值和实现细节并不统一,有的叫 typical_p,有的把它和其他采样器串在一起。具体行为请以所用库的官方文档为准。
  • 对普通用户来说,它的存在解释了一件反直觉的事:让模型“挑最可能的词”并不等于让回答更好。合适的随机性加上对低信息量词的过滤,反而让输出更像人话。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。