跳到主内容
快讯直播
AI智模界
AI 词典

动态分辨率切图(Tiling):让大图既看得清又看得全

一句话定义:动态分辨率切图(Tiling)是指处理大尺寸图片时,不把它硬塞成一张小图喂给模型,而是把它切成若干块高清小图,再额外配一张整图缩略图一起送进去,让模型同时掌握"局部细节"和"全局构图"。

为什么不能直接缩?

多模态模型(Vision-Language Model)的视觉编码器通常只吃固定尺寸的输入,比如 336×336 或 448×448 像素。你要给它一张 4000×3000 的扫描合同、一张超宽幅的设计稿,硬缩到 448×448 会发生什么?正文小字糊成一团,表格线粘连在一起,页眉页脚的印章细节全没了。就像把一本 A4 杂志影印到邮票大小——轮廓还在,内容全丢。

切图 + 缩略图:两路并行

主流做法是把原图按网格切成 N 块(常见的切法有固定网格、按长宽比自适应等),每块单独缩放到模型能吃下的尺寸,这样每块都保留了很高的有效分辨率,字还是字,图还是图。但只喂切片会出问题:模型看到的是"第 3 块""第 7 块",不知道它们之间的空间关系,更不知道整张图到底是什么——是海报还是个界面截图?主体在左上还是右下?

所以还要再补一路:把整张图缩成一张低分辨率全局图,也送进模型。切片负责"看清细节",全局图负责"知道这是什么、各部分在哪"。两路拼接后一起送进大语言模型(LLM)做推理。

和相邻概念的区别

概念做法主要解决的问题
直接缩放整图缩到固定尺寸省算力,但细节丢失严重
固定切图只切块,不看全局细节清晰,但丢失空间与整体语义
动态分辨率切图切块 + 全局缩略图细节与全局兼顾,块数可按图片长宽比动态决定

和图像分类里的"滑动窗口"相比,切图的目的是保留信息而非检测目标;和 OCR 的分页处理相比,切图更像一种"喂数据给模型"的输入组织策略,而非后处理。另外,"动态"二字体现在切几块、怎么切会随图片长宽比变化——宽图多切几列,长图多切几行,而不是死板地一刀切四块。

对从业者的实际意义

做文档理解、票据识别、长截图问答、UI 自动化这类产品时,切图往往是效果的第一道分水岭:不切,模型连小字都读不出来;切了不配缩略图,模型容易答非所问。工程上要注意的是切块数量直接决定 token 消耗和延迟,块间要不要留重叠、全局图放几成分辨率,都需要按业务实测。普通职场人可以在心里建立一个直觉:你给模型的图越复杂,越要关心它到底"看"到的是什么分辨率。各家模型的预处理方式、支持的切图策略和参数都不相同,具体以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。