一句话定义:智能体预算(Agent Budget)是给一个 AI 智能体(Agent)执行任务时预先设好的四类上限——token 用量、执行步数、耗时和金额,任何一项触顶就停下来,而不是让它一直跑下去。
为什么需要这道闸
聊天机器人是「一问一答」,你发一次消息,它回一次,成本天然封顶。智能体不一样:它会自己决定下一步——思考、调用工具、读结果、再思考,循环往复。一个循环里可能包含十几次模型调用、几十次搜索或代码执行,每次调用都在烧 token,而 token 是花钱的。
麻烦在于,循环不一定会自己停。工具报错后重试、验证不通过就再来一遍、目标描述含糊导致反复试探,都可能让一个任务跑上几百步。等你发现账单异常时,钱和时间已经花出去了。
打个比方:这就像把活外包给一个团队。你不能只说「把这事办了」,还得说清楚预算多少、几天内要交、最多改几版、超了就先停下来汇报。保险丝也是同一个道理——不是等电线烧起来再救火,而是在电流超标的瞬间断开。
四个维度各管什么
| 维度 | 管的是什么 | 触顶后的典型处理 |
|---|---|---|
| token 预算 | 上下文累计消耗,含工具返回的内容 | 停止新增调用,返回已有结果 |
| 步数预算 | 循环轮次、工具调用次数 | 中断循环,输出当前进展 |
| 时间预算 | 墙上时钟耗时 | 超时退出,避免用户干等 |
| 金额预算 | 按用量折算的硬性花费上限 | 直接终止,告警或转人工 |
四者要一起设。只限时间,智能体可能在几秒内密集调用很多次;只限金额,一个卡住的循环也可能拖住用户半小时。
和相邻概念的区别
限流(rate limit)管的是单位时间内请求次数,解决的是服务过载;预算管的是整个任务的总消耗。AI 词典:上下文窗口">上下文窗口(context window)是模型单次能装多少内容的技术边界,预算则是你主动划的策略红线。超时(timeout)只覆盖时间一个维度。护栏(guardrail)管的是内容安全和行为合规,预算管的是资源上限——两者通常一起上,一个防说错话,一个防花超支。
对从业者的意义
把预算当成接口的一等参数,和 prompt 一起传进去;子智能体要继承并切分父任务的预算,否则委派出去的子任务会变成脱缰的成本黑洞。每一步都记账,超限时优雅降级——返回部分结果并说明「我做到哪一步、为什么停」,比静默失败有用得多。具体计价方式和额度配置以各家官方页面为准。
对普通职场人的意义
当你让 AI「把所有资料都查一遍」「反复检查直到没问题」,你实际授权的是一次不封顶的支出。养成说清楚边界的习惯——最多查多少个来源、几分钟内给我初稿——既省钱,也逼自己把需求讲明白。
