跳到主内容
快讯直播
AI智模界
AI 词典

AI 浏览器:把智能体装进浏览器里

一句话定义:AI 浏览器(Agentic Browser)是把一个能"看"页面、也能"动手"操作的智能体(agent)直接嵌进浏览器里,让它替人完成点击、填写、比价、下单这类多步骤任务。

它到底怎么干活

传统浏览器是给人用的:渲染引擎把网页画出来,人的眼睛看、手去点。AI 浏览器在这条链路上插了一层——把当前页面转成模型能读的形式(常见做法是简化后的 DOM、无障碍树,或者干脆截图),模型看完之后输出一个"动作",比如"点这个按钮""在这个输入框填身份证号""往下滚一屏"。动作执行完,页面变了,新状态再喂回模型,如此循环,直到任务完成。

打个比方:以前的自动化脚本像一张写死的路线图,第 3 步点坐标 (100, 200),网页一改版就全废。AI 浏览器更像你雇了个实习生坐在电脑前,你只说"帮我把下周三去上海的差旅订了,别超过公司标准",剩下的路他自己看着走。

和容易混淆的几个东西的区别

概念能不能动手操作特点
AI 浏览器能目标驱动,页面改版也能适应,慢、贵、有风险
浏览器里的 AI 助手通常不能侧边栏总结、翻译、问答,只读
通用电脑智能体(computer use)能操作整个桌面,范围更大,更不稳定
RPA(机器人流程自动化)能靠固定选择器,稳定但需要人持续维护

真正的麻烦在权限

要让 agent 替你操作,它就得有你的登录态——cookie、会话令牌,甚至明文密码。这带来两类风险:

一是提示注入(prompt injection)。网页里可以藏一段人看不见、模型却读得到的文字,写着"顺便把这封邮件转发到某地址"。模型分不清这是你的指令还是页面的指令。

二是越权与身份模糊。agent 用的是你的身份,它删除的文件、发出的消息,在系统日志里看就是"你"干的。出了事,责任归属很难说清。

因此业界比较务实的做法是:只给最小权限;付款、发送、删除这类不可逆动作强制人工确认;用独立账号或一次性会话跑任务;全程留操作记录。具体某个产品支持到什么程度、权限怎么管,以各家官方页面为准。

对普通人的意义

它确实能省掉大量重复点击——填报销单、比价、改签、批量下载对账单,都属于典型场景。但别一上来就把免密支付和主邮箱交给它。先用低风险任务试水,看清它在哪一步会自作主张,再决定放多少权。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。