一句话定义
System 1 智能体(System 1 Agent)是一类把"点鼠标、敲键盘"这类低层操作交给小模型做毫秒级反射的电脑操作智能体(AI 词典:Computer-Using Agent">Computer-Using Agent,CUA),而把"该做什么"留给慢速大模型去推理。以 CUA-S1 这类命名为代表的思路,指向的正是这种分层。
为什么需要它:一个司机的比方
开车时,你不会每踩一次刹车都重新思考人生。去哪、走哪条路属于"慢思考"(System 2,借自卡尼曼的双系统理论),而打方向盘、控油门属于"快思考"(System 1),发生在几十到几百毫秒内,你甚至意识不到自己在做决策。
现有 CUA 的别扭之处,是把这两件事塞进同一次推理:截屏 → 大视觉语言模型(Vision-Language Model,VLM)完整看一遍屏幕 → 输出"点 (x, y)" → 再截屏……每一步都要等上一两秒。放在静态页面上勉强能用;一遇到拖拽文件、悬停展开的子菜单、滑块、滚动加载,节奏一断,操作就失败。成本还随步数线性上涨:一个十分钟的任务,可能产生几百次大模型调用。
System 1 智能体的做法是分层。大模型只在关键节点出手:理解用户意图、拆解步骤、判断上一步是否成功。小模型负责一个高频闭环:拿到"把 A 拖到 B"这样的子目标后,自己截屏、定位、微调坐标、连续移动、失败重试,完成后回报结果。
| 维度 | 慢思考层(System 2) | 快思考层(System 1) |
|---|---|---|
| 负责什么 | 意图理解、任务规划、结果校验 | 定位、点击、拖拽、输入、重试 |
| 模型规模 | 大 | 小,可本地或近端部署 |
| 调用频率 | 每个子任务一次 | 每秒多次 |
| 延迟要求 | 秒级可接受 | 毫秒级 |
| 出错时 | 重新规划 | 立即重试或上报 |
和相邻概念的区别
跟"一个 VLM 端到端打天下"的 CUA 比,它把认知负荷和实时控制拆开了。跟传统 RPA(Robotic Process Automation,机器人流程自动化)比,RPA 靠固定坐标和控件 ID,界面一改就崩;System 1 智能体靠视觉泛化,能容忍按钮挪位、主题变化。它也不等于强化学习里的策略网络那种纯试错,更像是从大量人类操作录像里学出来的"手感"。
对从业者和普通职场人意味着什么
- 分工之后,延迟和成本的大头从"每一步都问大模型"变成"每个子任务问一次"。这确实是缓解 CUA 又慢又贵的主要方向。
- 但它不解决长程规划和意图歧义。反射再准,也不知道"帮我把这张报销单填了"到底该填哪张、哪个字段。
- 工程上真正的难点在两层之间的接口:子目标怎么下达、超时怎么处理、失败几次才上报。这更像设计一套分层控制系统,而不是调一个 API。
- 对普通人而言,体感是操作"顺"了:鼠标移动像有人真的在握,而不是一格一格地跳。
具体实现细节(模型规模、部署方式、支持的平台)以各家官方页面为准。
