跳到主内容
快讯直播
AI智模界
模型

苹果上线 LensVLM:长上下文压成图像,按需展开相关页

近日,Apple 在 Hugging Face 上上线了模型 LensVLM-9B,页面地址为 huggingface.co/apple/LensVLM-9B。从项目名称与定位来看,该模型聚焦一个具体问题:如何把超长上下文压缩成图像,并在此基础上只展开与任务相关的那部分页面。

对长上下文模型而言,直接把整份文档、代码库或报告塞进AI 词典:上下文窗口">上下文窗口,代价是 token 数量、显存占用与推理延迟同步攀升。LensVLM 给出的思路是把长文本先“图像化”——以页面图像的形式承载与压缩上下文信息,而不是逐 token 保留原文;当模型需要用到某部分内容时,再按需把相关页面展开成可读取的细节。这样,上下文的“常驻成本”与“按需成本”被拆分开来:整体以低成本的图像形式保存,只有真正被检索到的页面才被高分辨率地“打开”。

这一设计处在长上下文、检索增强与多模态三条技术路线的交汇处。一方面,它沿用了“先压缩、后还原”的上下文管理思路;另一方面,图像作为中间表示,天然绕开了纯文本 token 化带来的长度瓶颈。对需要处理大量文档、合同、论文或代码的从业者来说,如果“按需展开”能够做到准确的相关页定位,就有机会在同等算力下处理更长的输入。

目前该模型页面未附摘要信息,训练数据、评测结果与使用范围等细节仍待进一步披露。从命名中的 9B 来看,其面向的可能是可本地部署的中等体量场景。后续值得关注的问题包括:图像压缩是否带来信息损失、相关页的判定由模型自身还是外部检索完成,以及它与常规长上下文方案的实测对比。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。