跳到主内容
快讯直播
AI智模界
AI 词典

推理强度 / 思考预算:模型「想多久」的那个旋钮

推理强度(Reasoning Effort),有些平台叫思考预算(Thinking Budget),指的是模型在给出最终答案之前,允许自己花多少内部推理 token 去「想」这件事。

早期的模型基本是脱口而出:读题,然后一个词一个词往外吐答案。现在的推理模型多了一段你看不见的草稿纸——它会先产生一段内部推理(reasoning tokens):拆解问题、试错、推翻自己、重新来过,最后才写出给你看的答案。推理强度就是这张草稿纸的额度。额度小,想两步就作答;额度大,它可以在里面反复推演。

打个比方,像考试打草稿。选择题口算就够了;压轴大题你得在草稿纸上列式、代入、验算、发现不对再重来。草稿纸给足,难题才做得出来。但如果每道口算题都必须先写满一页草稿纸,除了浪费时间没有任何收益。

它和「温度」不是一回事

很多人只熟悉温度,以为把温度调低就等于「让它认真想」。这是两码事。

参数控制什么你感受到的变化
温度(AI 词典:Temperature">Temperature)采样的随机性答案更发散还是更稳
最大输出(Max Tokens)一次生成的总长度上限会不会被提前截断
推理强度内部思考花掉多少 token想得深、慢、贵

三者独立,又互相牵制:推理 token 通常也算在输出配额里,思考预算开大却不抬高输出上限,答案可能还没写完就被切断。

为什么简单任务调高反而更差

三个原因,缺一不可地同时出现:

一、慢。思考 token 也是一个字一个字生成的,额度越大,你盯着转圈的时间越长。一个字段抽取任务本来半秒出结果,调高后可能要等好几秒。

二、贵。推理 token 一般照常计费,成本随思考量线性上涨。具体口径各家不同,以官方页面为准。

三、质量可能下降。明明是简单任务,模型却在自己制造的分岔路上越走越远:过度分析、把用户没说的假设当成既定事实、绕一圈回来把原本正确的答案改错。业内管这叫过度思考(overthinking)。它不是「想得多的必然代价」,而是「在不需要想的地方硬想」的副作用。

怎么调

分类、抽取、改写、翻译、格式转换这类目标明确的活,低档就够,快且省。数学推导、多步代码调试、复杂规划、需求本身有歧义需要权衡的,才值得往上加。多数平台的默认档位大约在中间,不确定就先跑默认档,只在两种情况动手:明显不够用(漏步骤、算错),或者明显在想偏(啰嗦、自我怀疑、反复改口)。

把它当成出差预算,不是马力旋钮:该省的时候省,该花的时候别心疼。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。