一句话定义:Context-as-Image 压缩(Context-as-Image Compression)是把超长上下文先渲染成页面图像,再由视觉编码器(vision encoder)整体压成视觉 token(visual token),需要时按页展开细读的上下文管理方法。
打个比方:纯 token 压缩像把一本书逐字改写成摘要,删掉的字很难找回;上下文图像化像把书拍成缩微胶片,先保留整页排版,等真正要查某一页,再放大做 OCR(Optical Character Recognition,光学字符识别)或细粒度理解。LensVLM 这类思路的关键就是“先粗存,后细读”。
原理:传统长文本进模型,token 数随字数线性增长,注意力开销还会放大。图像化走的是另一条路:一整页文字先被渲染成图片,视觉编码器把图片切成小块(patch),每块压成一个或几个视觉 token。一页可能上千字,但压完只剩较少的视觉 token。问题来了,先用轻量检索选中相关页,只让这些页进入高分辨率解码或 OCR,无关页继续以粗粒度保留。于是长上下文不再按原始 token 长度算钱,而按页数、分辨率和相关页数量算。
和纯 token 压缩的区别
| 维度 | 纯 token 压缩 | Context-as-Image 压缩 |
|---|---|---|
| 压缩对象 | 文本 token 序列 | 页面图像/视觉 token |
| 保留信息 | 依赖摘要,易丢字词 | 保留版面、表格、字体等 |
| 成本增长 | 随 token 数增长 | 随页数/像素增长,文档场景常更省 |
| 展开方式 | 难无损还原 | 可按页重新高清读取 |
| 主要风险 | 摘要丢细节 | 渲染模糊、OCR 错、检索错页 |
对从业者的意义:做合同、财报、代码库、论文库的 RAG(Retrieval-Augmented Generation,AI 词典:检索增强生成">检索增强生成)时,可以把“全量长文本”换成“图像化粗索引 + 相关页精读”。成本大头从 token 长度转向图像分辨率和页数;对普通人,长文档问答可能更快更便宜。
精度代价:图像化不是无损压缩。小字、公式、颜色、复杂表格在渲染和编码时可能失真;视觉编码器也有信息瓶颈。若按需展开时检索错页,答案会错。所以它更适合做“高召回粗筛 + 精读核对”,关键数字仍要回原页确认。具体能力以官方页面或论文为准。
