推理强度(Reasoning Effort),有些平台叫思考预算(Thinking Budget),指的是模型在给出最终答案之前,允许自己花多少内部推理 token 去「想」这件事。
早期的模型基本是脱口而出:读题,然后一个词一个词往外吐答案。现在的推理模型多了一段你看不见的草稿纸——它会先产生一段内部推理(reasoning tokens):拆解问题、试错、推翻自己、重新来过,最后才写出给你看的答案。推理强度就是这张草稿纸的额度。额度小,想两步就作答;额度大,它可以在里面反复推演。
打个比方,像考试打草稿。选择题口算就够了;压轴大题你得在草稿纸上列式、代入、验算、发现不对再重来。草稿纸给足,难题才做得出来。但如果每道口算题都必须先写满一页草稿纸,除了浪费时间没有任何收益。
它和「温度」不是一回事
很多人只熟悉温度,以为把温度调低就等于「让它认真想」。这是两码事。
| 参数 | 控制什么 | 你感受到的变化 |
|---|---|---|
| 温度(AI 词典:Temperature">Temperature) | 采样的随机性 | 答案更发散还是更稳 |
| 最大输出(Max Tokens) | 一次生成的总长度上限 | 会不会被提前截断 |
| 推理强度 | 内部思考花掉多少 token | 想得深、慢、贵 |
三者独立,又互相牵制:推理 token 通常也算在输出配额里,思考预算开大却不抬高输出上限,答案可能还没写完就被切断。
为什么简单任务调高反而更差
三个原因,缺一不可地同时出现:
一、慢。思考 token 也是一个字一个字生成的,额度越大,你盯着转圈的时间越长。一个字段抽取任务本来半秒出结果,调高后可能要等好几秒。
二、贵。推理 token 一般照常计费,成本随思考量线性上涨。具体口径各家不同,以官方页面为准。
三、质量可能下降。明明是简单任务,模型却在自己制造的分岔路上越走越远:过度分析、把用户没说的假设当成既定事实、绕一圈回来把原本正确的答案改错。业内管这叫过度思考(overthinking)。它不是「想得多的必然代价」,而是「在不需要想的地方硬想」的副作用。
怎么调
分类、抽取、改写、翻译、格式转换这类目标明确的活,低档就够,快且省。数学推导、多步代码调试、复杂规划、需求本身有歧义需要权衡的,才值得往上加。多数平台的默认档位大约在中间,不确定就先跑默认档,只在两种情况动手:明显不够用(漏步骤、算错),或者明显在想偏(啰嗦、自我怀疑、反复改口)。
把它当成出差预算,不是马力旋钮:该省的时候省,该花的时候别心疼。
