跳到主内容
快讯直播
AI智模界
AI 词典

Guided Vision(引导式视觉):先框住,再提问

Guided Vision(引导式视觉)是一种让用户在提问之前,先在画面上圈出自己关心的那一小块区域,模型再针对这块区域作答的交互方式。一句话概括:把「整张图你看懂后告诉我」换成「我指哪儿,你答哪儿」。

这件事看起来只是多了个框选动作,实际改变的是注意力的分配权。过去把一整页合同、一张长截图丢给视觉语言模型(Vision-Language Model, VLM),模型要先自己判断「图里哪些地方重要」,再读、再答。图一长、字一小,它就容易看错行、漏掉脚注、把 A 列的数字算到 B 列去。Guided Vision 把「指位置」这一步交还给人——人做这件事几乎不花力气,而且极其可靠;模型则专心做它擅长的:读字、解释含义、回答问题。

打个比方:朋友陪你看一份密密麻麻的租房合同,你说「整份合同讲了啥」,他翻一遍只给你个概况;你用手指按住其中一行说「这句什么意思」,他才会逐字给你拆。框选就是那根手指。

它和相邻概念的区别很值得分清:

谁决定看哪里输出是什么典型短板
Guided Vision用户框选(Region of Interest, ROI)对该区域的解释与回答框外信息(表头、单位、脚注)会丢
普通截图问答模型自己判断对整图的概括或回答长图小字容易看错、答偏
OCR(光学字符识别)不需要纯文本不解释、不理解版式、不回答「这对意味着什么」

注意第三行:OCR 只是把像素变成字,Guided Vision 是在字之上给判断。两者常配合,但目标不同。

具体场景里的正确用法:

长截图。 别一次性整张上传。按段落一屏一屏框,逐段推进,结论会更稳。

小字合同。 框住的区域尽量包含「条款正文+紧邻的表头或标题」,然后问「这句话对乙方意味着什么」。只框一行、丢掉上下文,是最常见的翻车原因。

仪表盘与报表。 框住单个读数区问「这个值是否超出正常范围」很有效;但趋势判断、多指标关联这类问题依赖整体版式,框得太小反而答不准。

表格单元格。 顺着列框,比框单个格子更安全,因为列头就是天然的单位说明。

几条边界必须说清楚。第一,框选只限定范围,不提升像素——反光、倾斜、手写体、艺术字,圈得再准也读不出来,该重拍就重拍。第二,模型有时会「越界」回答,你只框了价格,它顺手把整张表都推断了,关键结论要追问一句「只根据框内内容回答」。第三,框选不等于脱敏,上传的往往仍是整张图,敏感信息请先裁掉。

对从业者的启发更朴素:想提高准确率,不一定非得换更大的模型。先让用户动一下手指,把模型的自由发挥空间收窄,很多场景的体验就会明显变好。至于谷歌这项功能具体支持哪些入口、哪些文件类型,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。