跳到主内容
快讯直播
AI智模界
AI 词典

Logprobs(对数概率):模型给每个字打的"信心分"

一句话定义:Logprobs(对数概率)是语言模型对每个候选 token 输出的概率取自然对数后的值,它回答的是"模型对这一步输出有多确信"。

它是怎么来的

大模型生成文字时并不是直接从脑子里蹦出一个词,而是先给词表里每个可能的 token 打分(这些原始分数叫 logits),再用 softmax 归一化成概率分布,最后要么取最大(贪心解码),要么按概率随机抽(采样)。这个概率取自然对数,就是 logprob。

因为是概率的对数,它落在负无穷到 0 之间:概率越接近 1,logprob 越接近 0。

概率logprob直觉
1.00闭着眼都知道
0.5≈ -0.69五五开
0.1≈ -2.3有点悬
0.001≈ -6.9基本是瞎猜

打个比方:logprob 就像答题人写在脸上的自信程度。答案对不对先不论,-0.01 是脱口而出,-8 是硬凑出来的。

为什么不用概率本身而用对数?一是概率连乘容易数值下溢,取对数后连乘变连加;二是低概率区间区分度更好,-3 和 -4 的差别一眼可见,而 0.001 和 0.0001 看着都像 0。

和相邻概念的区别

  • logits 是 softmax 之前的原始分数,未归一化,可以任意大;logprob 是归一化后再取对数,量纲统一、可比较。
  • probability 和 logprob 是同一信息的两种表达,指数一下就能互相换算。
  • temperature、top_p、top_k 这类采样参数会改变实际用于采样的分布,从而改变观测到的 logprob——温度调高,分布变平,原本高概率 token 的 logprob 反而更负。

对实际工作的意义

1. 做分类:把候选标签当输出,比较它们的 logprob,谁高选谁。这是少样本分类的常见套路,不用训练就能落地。

2. 阈值与校准:给平均对数概率设个阈值,低于阈值的回答就转人工、触发检索或直接拒答,这是把"模型不确定性"接进业务流程的最直接方式。

3. 幻觉排查:低置信度的位置往往就是编造的起点,可以定位到具体 token 而不是整句话。

4. 模型评估困惑度(perplexity)本质上就是平均 logprob 的指数形式,数值越低说明模型对文本越不意外。

几个别踩的坑

logprob 高不等于正确,模型会"自信地错";不同模型之间的 logprob 不能直接横向比较,因为 tokenizer 和训练目标不同;也不要简单把一句话里各步的 logprob 相乘当作整句概率,采样过程和上下文变化会让这个数失去意义。至于哪些接口会返回该字段、参数怎么传,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。