跳到主内容
快讯直播
AI智模界
AI 词典

视觉接地 vs DOM 接地:看屏幕还是读结构

一句话定义

接地(AI 词典:Grounding">Grounding)指的是把"我想做什么"落到界面上的一个具体位置——点哪个按钮、往哪个框里填字。视觉接地(Vision Grounding)靠看截图,直接算出该点哪个像素坐标;DOM 接地(DOM Grounding)靠读网页结构,先找到那个元素节点,再对它下手。

打个比方

去一栋陌生大楼找人,有两条路。

第一条:站在楼下看照片,凭"三楼从左数第二个窗户"来判断。这就是视觉接地——不需要任何内部资料,什么楼都能试着找,但楼换了外墙颜色、加了遮挡、或者两个窗户长得一模一样,就容易认错。

第二条:拿到楼层平面图和房间号,直接走到 302。这就是 DOM 接地——只要图纸是对的,定位又快又准;可要是对方压根不给图纸(比如界面是画在画布上的),或者图纸早就过期了,那就傻眼。

两条路线的取舍

维度视觉接地DOM 接地
输入截图/画面像素HTML、无障碍树(Accessibility Tree)等结构信息
定位结果坐标 (x, y)元素节点、选择器、元素编号
鲁棒性界面改版、缩放、换主题都会漂移;但非标准控件也能处理结构干净时很稳;动态类名、嵌套 iframe、纯 Canvas 就失灵
速度通常更慢,要先截图再跑视觉模型通常更快,解析的是文本,token 也少
成本通常更高,图片输入更贵通常更低
典型盲区截图外的内容、悬停才出现的菜单、滚动后才加载的区域没有文字标签的图标按钮、图片按钮、自绘控件

容易混淆的邻居

OCR(光学字符识别)只是把图上的字读出来,读出"提交"两个字不等于知道该点哪里;视觉接地要的是坐标。同样,DOM 接地也不等于爬虫——爬虫关心整页内容,DOM 接地只关心"此刻哪个元素可点、可输入"。另外还有一条中间路线:读无障碍树,它比原始 HTML 更接近"人能理解的控件清单",但覆盖度取决于页面作者写没写。

对从业者的意义

实际系统很少只走一条路,常见做法是"先读结构,读不到再回退到视觉",或者两边都跑、互相校验。评测时要把两类失败分开统计:是"没找到",还是"找到了但点偏了"——前者多半是结构问题,后者多半是坐标映射问题,修的地方完全不同。涉及具体实现和接口,以官方文档为准。

对普通职场人的意义

当你的浏览器助手点错按钮时,它可能不是在"理解错你的话",而是走了一条不合适的路线:截图里两个灰色按钮长得太像,或者页面结构里那个按钮根本没名字。知道这个区别,你在描述需求时就能多给一句"就是页面上那个蓝色的、写着导出的按钮",往往比反复重试更有效。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。