一句话定义:AI 浏览器(Agentic Browser)是把一个能"看"页面、也能"动手"操作的智能体(agent)直接嵌进浏览器里,让它替人完成点击、填写、比价、下单这类多步骤任务。
它到底怎么干活
传统浏览器是给人用的:渲染引擎把网页画出来,人的眼睛看、手去点。AI 浏览器在这条链路上插了一层——把当前页面转成模型能读的形式(常见做法是简化后的 DOM、无障碍树,或者干脆截图),模型看完之后输出一个"动作",比如"点这个按钮""在这个输入框填身份证号""往下滚一屏"。动作执行完,页面变了,新状态再喂回模型,如此循环,直到任务完成。
打个比方:以前的自动化脚本像一张写死的路线图,第 3 步点坐标 (100, 200),网页一改版就全废。AI 浏览器更像你雇了个实习生坐在电脑前,你只说"帮我把下周三去上海的差旅订了,别超过公司标准",剩下的路他自己看着走。
和容易混淆的几个东西的区别
| 概念 | 能不能动手操作 | 特点 |
|---|---|---|
| AI 浏览器 | 能 | 目标驱动,页面改版也能适应,慢、贵、有风险 |
| 浏览器里的 AI 助手 | 通常不能 | 侧边栏总结、翻译、问答,只读 |
| 通用电脑智能体(computer use) | 能 | 操作整个桌面,范围更大,更不稳定 |
| RPA(机器人流程自动化) | 能 | 靠固定选择器,稳定但需要人持续维护 |
真正的麻烦在权限
要让 agent 替你操作,它就得有你的登录态——cookie、会话令牌,甚至明文密码。这带来两类风险:
一是提示注入(prompt injection)。网页里可以藏一段人看不见、模型却读得到的文字,写着"顺便把这封邮件转发到某地址"。模型分不清这是你的指令还是页面的指令。
二是越权与身份模糊。agent 用的是你的身份,它删除的文件、发出的消息,在系统日志里看就是"你"干的。出了事,责任归属很难说清。
因此业界比较务实的做法是:只给最小权限;付款、发送、删除这类不可逆动作强制人工确认;用独立账号或一次性会话跑任务;全程留操作记录。具体某个产品支持到什么程度、权限怎么管,以各家官方页面为准。
对普通人的意义
它确实能省掉大量重复点击——填报销单、比价、改签、批量下载对账单,都属于典型场景。但别一上来就把免密支付和主邮箱交给它。先用低风险任务试水,看清它在哪一步会自作主张,再决定放多少权。
