Guided Vision(引导式视觉)是一种让用户在提问之前,先在画面上圈出自己关心的那一小块区域,模型再针对这块区域作答的交互方式。一句话概括:把「整张图你看懂后告诉我」换成「我指哪儿,你答哪儿」。
这件事看起来只是多了个框选动作,实际改变的是注意力的分配权。过去把一整页合同、一张长截图丢给视觉语言模型(Vision-Language Model, VLM),模型要先自己判断「图里哪些地方重要」,再读、再答。图一长、字一小,它就容易看错行、漏掉脚注、把 A 列的数字算到 B 列去。Guided Vision 把「指位置」这一步交还给人——人做这件事几乎不花力气,而且极其可靠;模型则专心做它擅长的:读字、解释含义、回答问题。
打个比方:朋友陪你看一份密密麻麻的租房合同,你说「整份合同讲了啥」,他翻一遍只给你个概况;你用手指按住其中一行说「这句什么意思」,他才会逐字给你拆。框选就是那根手指。
它和相邻概念的区别很值得分清:
| 谁决定看哪里 | 输出是什么 | 典型短板 | |
|---|---|---|---|
| Guided Vision | 用户框选(Region of Interest, ROI) | 对该区域的解释与回答 | 框外信息(表头、单位、脚注)会丢 |
| 普通截图问答 | 模型自己判断 | 对整图的概括或回答 | 长图小字容易看错、答偏 |
| OCR(光学字符识别) | 不需要 | 纯文本 | 不解释、不理解版式、不回答「这对意味着什么」 |
注意第三行:OCR 只是把像素变成字,Guided Vision 是在字之上给判断。两者常配合,但目标不同。
具体场景里的正确用法:
长截图。 别一次性整张上传。按段落一屏一屏框,逐段推进,结论会更稳。
小字合同。 框住的区域尽量包含「条款正文+紧邻的表头或标题」,然后问「这句话对乙方意味着什么」。只框一行、丢掉上下文,是最常见的翻车原因。
仪表盘与报表。 框住单个读数区问「这个值是否超出正常范围」很有效;但趋势判断、多指标关联这类问题依赖整体版式,框得太小反而答不准。
表格单元格。 顺着列框,比框单个格子更安全,因为列头就是天然的单位说明。
几条边界必须说清楚。第一,框选只限定范围,不提升像素——反光、倾斜、手写体、艺术字,圈得再准也读不出来,该重拍就重拍。第二,模型有时会「越界」回答,你只框了价格,它顺手把整张表都推断了,关键结论要追问一句「只根据框内内容回答」。第三,框选不等于脱敏,上传的往往仍是整张图,敏感信息请先裁掉。
对从业者的启发更朴素:想提高准确率,不一定非得换更大的模型。先让用户动一下手指,把模型的自由发挥空间收窄,很多场景的体验就会明显变好。至于谷歌这项功能具体支持哪些入口、哪些文件类型,以官方页面为准。
