温度(Temperature)是控制大语言模型每一步「选词」随机程度的参数:调低,输出更确定、更保守;调高,输出更发散、更意外。
它到底在调什么
模型生成每个词时,并不是先想好了一个词,而是先给词表里每个候选词算一个分数,再把这些分数换算成概率。温度就作用在这个概率分布上:温度越低,分布被「拉尖」,本来概率高的词优势被放大;温度越高,分布被「压平」,长尾的冷门词也有了被抽中的机会。温度趋近 0 时,几乎等同于每次都挑概率最高的那个词。
打个比方:模型每写一个字,都像从一个签筒里抽签。低温的筒里基本只放最顺理成章的那几支签;高温的筒里混进了大量稀奇古怪的选项,抽出来可能是神来之笔,也可能是胡说八道。
和相邻概念的区别
最容易被混淆的是 AI 词典:Top-p">Top-p(核采样,nucleus sampling)和 Top-k。温度改的是「权重」——所有候选词都还在,只是相对高低变了;Top-p / Top-k 改的是「名单」——先把概率最低的一大批候选直接剔除,只在剩下的小圈子里抽签。两者通常一起使用:先用 Top-p 划定范围,再用温度决定在这个范围里抽得多任性。
对实际工作意味着什么
| 温度 | 分布形态 | 体感 | 典型用途 |
|---|---|---|---|
| 接近 0 | 极尖锐 | 稳定、可复现,偶尔死板重复 | 事实问答、代码、JSON/SQL 等结构化输出、工具调用 |
| 中间 | 适度平缓 | 自然、有变化但不跑偏 | 日常对话、写作、翻译润色 |
| 偏高 | 平坦 | 天马行空,惊喜与跑题并存 | 头脑风暴、起名、创意文案、批量生成备选方案 |
几个容易踩的坑:
- 温度不是「聪明度」旋钮。调高不会让模型更懂行,只会更不可预测;调低也不会让它变笨,只是更保守。
- 温度治不了知识盲区。模型没学过的内容,调到什么温度都变不出正确答案,只会编得更花哨或更死板。
- 温度设成 0 也不等于绝对可复现。多数实现会退化成贪心解码,但推理过程的数值细节仍可能带来细微差异。
- 各平台的默认值、可调范围和上限并不一致,具体以官方页面为准。
一句话选择法:要标准答案就往下拧,要更多可能性就往上拧,中间地带留给日常聊天和写作。
