一句话定义:Dots 是 OpenAI 面向个人电脑推出的桌面智能体(desktop agent)应用——它不满足于在对话框里回答你,而是拿到你屏幕的"看"与"动手"能力,替你操作本机软件:点按钮、填表单、跨应用搬数据。
为什么聊天窗口不够用
ChatGPT 桌面端解决的是"你给材料、它给答案":写邮件、改文案、总结文档、查资料。但真实办公里大量任务卡在最后那一公里——"必须有人点一下"。把十封邮件里的发票金额抄进表格,聊天框帮不上忙,因为它碰不到你的邮件客户端和 Excel。Dots 这类产品要补的就是这一公里。
它大概怎么工作
可以把它想成一位坐在你旁边、和你共用同一台电脑的实习生:
1. 看:截屏或读取界面元素(无障碍树 accessibility tree),搞清当前屏幕上有什么。
2. 想:大模型把"帮我把本周发票整理成表"拆成可执行的步骤。
3. 做:调用鼠标键盘事件,或走应用自身提供的接口。
4. 核:再"看"一眼结果对不对,不对就重试或停下来问你。
这条"看—想—做—核"的循环,是所有桌面代操作类智能体的通用骨架,各家差别主要在感知手段、权限设计和失败处理上。
和相邻概念的区别
| 形态 | 代表方向 | 交互方式 | 典型场景 |
|---|---|---|---|
| 对话式助手 | ChatGPT 桌面端 | 你问它答,你负责复制粘贴 | 写作、总结、检索 |
| 桌面代操作智能体 | Dots | 它看屏幕、自己动手,你验收 | 跨应用的重复流程 |
| 平台/终端内智能体 | Meta 的 Muse 等方向 | 嵌在系统或某个 App 里被唤起 | 平台内任务、设备侧任务 |
一句话概括分工:ChatGPT 桌面端是"嘴和脑",Dots 是"手",而 Meta 那类探索更像是把"手"提前长在自家生态里。三者的边界目前还在快速移动,具体形态、支持范围与调用方式请以官方页面为准。
对普通人和从业者意味着什么
对普通人:省下的是"搬运工"时间,但要留意权限。代操作意味着它能碰到你的邮件、文档、账单。稳妥做法是最小授权——只给它这件事需要的文件和应用,涉及付款、删除、对外发送这类不可逆动作,第一遍盯着它做。
对从业者:入口之争的评判标准变了。过去比"谁的模型更聪明",现在比"谁离用户的工作现场更近"。聊天框是一个入口,桌面是另一个,而且更贴近活儿本身。谁能把权限、可靠性和可回滚性做扎实,谁才守得住这个入口。
