一句话定义
状态机驱动的智能体(State-Machine / Graph Agent)就是把智能体的执行过程画成一张有向图:每个节点是一个明确步骤,每条边是一次条件跳转,大语言模型(LLM)只在节点内部负责理解、判断和生成,而不负责决定整条路怎么走。
它到底在解决什么
打个比方。机场登机流程是:值机 → 安检 → 登机口 → 登机。每个柜台的工作人员可以自由发挥——怎么问话、怎么解释规定由他决定——但他不能跳过安检直接把你送上飞机。状态机智能体就是这个意思:流程是硬骨架,语言模型是骨架里的血肉。
而"自由发挥型"智能体,常见形态是 AI 词典:ReAct">ReAct 那类循环:想一步、调个工具、看结果、再想一步。它像雇了个全能跑腿的人,你只说"帮我把这事办了"。他可能很聪明,也可能绕圈、忘事、中途把预算花光。
把自由关起来,换的是三样东西:
- 可控性:哪些步骤不可跳过、什么时候必须问人,写在图里,而不是指望模型每次都记得。
- 可恢复性:图有明确的节点名,可以在节点边界存快照(checkpoint)。第三步失败了,改完参数从第三步续跑,不必从头再来。
- 可观测性:日志里不是一大段思考文本,而是一串"进入校验节点 → 进入查询节点",出问题能定位到具体一格。
代价也很清楚:你得提前想清楚流程,处理不了完全开放的任务;图切得越细,维护成本越高。
和相邻概念的区别
| 维度 | 自由循环智能体 | 状态机 / 图智能体 |
|---|---|---|
| 谁决定下一步 | 模型临场决定 | 图上的边与条件 |
| 路径可预测性 | 低 | 高 |
| 失败后怎么办 | 通常从头重来 | 从失败节点续跑 |
| 适合任务 | 探索、开放式问答 | 有规矩的业务流程 |
| 灵活性 | 高 | 受流程约束 |
和工作流(workflow)引擎相比:传统工作流常是静态 DAG(有向无环图),走不回去;图智能体允许成环和回退,节点内可以放模型判断,还能插入人工审批节点。至于多智能体(multi-agent),它谈的是"有几个角色",和这里谈的"流程长什么样"是两个维度,可以叠加使用。
对实际工作的意义
从业者可以记成一句话:把确定性交给图,把不确定性关进节点。 流程骨架用代码画死,需要"理解模糊意图"的地方再放模型。
普通人不一定看得见这层结构,但能感觉到差别:某个 AI 客服能稳稳地帮你改地址、退订单、寄补件,往往不是模型更聪明,而是流程被画成了一张图。具体框架的接口和能力边界,以各家官方页面为准。
