一句话定义
接地(AI 词典:Grounding">Grounding)指的是把"我想做什么"落到界面上的一个具体位置——点哪个按钮、往哪个框里填字。视觉接地(Vision Grounding)靠看截图,直接算出该点哪个像素坐标;DOM 接地(DOM Grounding)靠读网页结构,先找到那个元素节点,再对它下手。
打个比方
去一栋陌生大楼找人,有两条路。
第一条:站在楼下看照片,凭"三楼从左数第二个窗户"来判断。这就是视觉接地——不需要任何内部资料,什么楼都能试着找,但楼换了外墙颜色、加了遮挡、或者两个窗户长得一模一样,就容易认错。
第二条:拿到楼层平面图和房间号,直接走到 302。这就是 DOM 接地——只要图纸是对的,定位又快又准;可要是对方压根不给图纸(比如界面是画在画布上的),或者图纸早就过期了,那就傻眼。
两条路线的取舍
| 维度 | 视觉接地 | DOM 接地 |
|---|---|---|
| 输入 | 截图/画面像素 | HTML、无障碍树(Accessibility Tree)等结构信息 |
| 定位结果 | 坐标 (x, y) | 元素节点、选择器、元素编号 |
| 鲁棒性 | 界面改版、缩放、换主题都会漂移;但非标准控件也能处理 | 结构干净时很稳;动态类名、嵌套 iframe、纯 Canvas 就失灵 |
| 速度 | 通常更慢,要先截图再跑视觉模型 | 通常更快,解析的是文本,token 也少 |
| 成本 | 通常更高,图片输入更贵 | 通常更低 |
| 典型盲区 | 截图外的内容、悬停才出现的菜单、滚动后才加载的区域 | 没有文字标签的图标按钮、图片按钮、自绘控件 |
容易混淆的邻居
OCR(光学字符识别)只是把图上的字读出来,读出"提交"两个字不等于知道该点哪里;视觉接地要的是坐标。同样,DOM 接地也不等于爬虫——爬虫关心整页内容,DOM 接地只关心"此刻哪个元素可点、可输入"。另外还有一条中间路线:读无障碍树,它比原始 HTML 更接近"人能理解的控件清单",但覆盖度取决于页面作者写没写。
对从业者的意义
实际系统很少只走一条路,常见做法是"先读结构,读不到再回退到视觉",或者两边都跑、互相校验。评测时要把两类失败分开统计:是"没找到",还是"找到了但点偏了"——前者多半是结构问题,后者多半是坐标映射问题,修的地方完全不同。涉及具体实现和接口,以官方文档为准。
对普通职场人的意义
当你的浏览器助手点错按钮时,它可能不是在"理解错你的话",而是走了一条不合适的路线:截图里两个灰色按钮长得太像,或者页面结构里那个按钮根本没名字。知道这个区别,你在描述需求时就能多给一句"就是页面上那个蓝色的、写着导出的按钮",往往比反复重试更有效。
