置信度(confidence)是模型对自己答案的把握程度;校准(Calibration)问的是这份把握准不准——模型说"八成确定"的那些题,是不是真有八成答对了。
天气预报是最好的参照。预报说"今天降水概率 70%",如果一年里所有报 70% 的日子,真有约七成下了雨,这个预报就是校准良好的。模型也一样:它在 1000 道题上都说"我有 90% 把握",结果只答对 620 道,那这个 90% 就是虚的,属于过度自信(overconfidence);反过来答对了 970 道,就是欠自信(underconfidence)。现实中大模型更常见的是前者,尤其经过微调">指令微调(instruction tuning)和人类反馈强化学习(RLHF)之后——训练数据里的回答往往语气笃定,模型学到的是"听起来确定",而不是"知道自己哪里会错"。还要记住,它输出的概率来自内部分数归一化,拟合的是语言规律,不是一份诚实的自我评估报告。
怎么测?把预测按置信度分桶(0.7~0.8、0.8~0.9……),每桶统计实际正确率,画成可靠性图(reliability diagram);再把各桶的偏差加权汇总,得到期望校准误差(Expected Calibration Error, ECE)。这是通用思路,具体实现各家有别,以官方文档为准。
| 概念 | 回答的问题 | 数值高说明 |
|---|---|---|
| 准确率 Accuracy | 一共答对多少 | 整体水平好 |
| 校准 Calibration | 说的把握准不准 | 概率可以当依据 |
| 区分度(如 AUROC) | 对错分得开吗 | 排序能力好 |
三者互相独立。一个模型可以 95% 准确却极度自信,也可以只有 60% 准确但概率诚实——后者往往更敢用,因为你敢按它设阈值。
对从业者,这决定了三件事。第一,别把模型嘴里的"我有 80% 把握"当真,那是生成出来的句子,不是概率值。第二,做自动决策(自动通过、拒答、转人工)时,校准比准确率更关键:校准好的模型可以设"低于某个置信度就转人工",成本才可控。常见修法是温度缩放(temperature scaling),在一个验证集上找温度参数把概率拉平或压尖;顺带一提,调低温度会让分布更尖锐、通常更过度自信,所以"降温度"和"做校准"是两件事。第三,分布漂移(distribution shift)会毁掉校准:换领域、换语言、隔几个月,原来标定好的阈值就不作数了,必须用自己业务的数据重新验证一遍。
对普通人,记住一句就够:模型报出的概率值得参考,但不值得直接当依据;当它愿意说"不确定"时,你才真正多了一个可信的信号。
