一句话定义:多模态(Multimodality)指的是让一个模型同时处理文字、图像、音频、视频等不同类型的信息,并把这些信息映射到同一套内部表示里,使它们能互相对照、互相补充、互相生成,而不是各管各的。
从「各管各的」到「共用一套表示」
每一种信息类型,在 AI 里叫一个模态(modality)。过去的做法是「一模态一系统」:OCR(Optical Character Recognition)只管认字,语音识别只管把声音转成文本,图像分类只管给图片打标签。每个系统输出各自的结果,再由人或一堆规则把它们串起来。
多模态的关键动作是对齐(alignment):把一张猫的照片和「一只猫」这句话,投影到同一个共享表示空间(shared embedding space)里,让语义相近的内容距离更近。这样「以文搜图」「以图搜文」「看着截图回答问题」在底层就变成了同一类操作——在这个空间里找最近的邻居,或者把多个模态的向量拼在一起交给后面的模型推理。
打个比方:像一个会议室的同声传译,把中文、英文、手语都翻成同一种「内部语言」,大家才能真正讨论同一件事。另一个比方是图书馆给所有语种的书都编了同一套索引号:你想找「关于孤独的作品」,不管它是中文小说、英文诗集,还是一部没有台词的电影,都能按内容而不是按载体被找到。
技术上,让不同模态互相对话的常见手段是跨模态注意力(cross-attention):处理文字时,模型会回头「看」图像里相关的区域;处理图像时,也会参考文字在说什么。
| 维度 | 单模态流水线 | 多模态模型 |
|---|---|---|
| 表示方式 | 每种模态一套特征 | 共享表示空间,可互相比较 |
| 模态交互 | 靠人工或规则拼接 | 模型内部跨模态注意力 |
| 出错形态 | 单点出错,较易定位 | 错误会跨模态传播 |
| 典型任务 | 语音转写、图像分类 | 图文问答、截图操作、视频理解 |
容易混淆的几个邻居
- 多模态 ≠ 多任务(multi-task):多任务是同一种输入做很多件事;多模态是很多种输入做同一件事或一组事。
- 多模态理解 vs 多模态生成:理解是把图像、声音变成语义;生成是反过来,把语义变成图像、声音。两者常被放在同一个模型里,但是不同的能力。
- 能「看到」不等于能「看懂」:模态之间会互相带偏,比如图里有误导性文字时,模型可能顺着文字走,产生跨模态的幻觉。
对普通人和从业者意味着什么
对普通人:拍一道题就能问、把会议录音和幻灯片一起丢给助手、用一句话搜出相册里某张照片、给视障用户实时描述眼前的画面,这些体验背后都是多模态在起作用。
对从业者:第一,配对数据(如图文对、音文对)比单模态数据难拿得多,数据质量往往比模型结构更决定上限;第二,评测要分层做——单独测每个模态,再测组合场景,否则很容易出现「单看都行、合起来就崩」;第三,多模态通常更贵更慢,工程上要权衡是否真的需要把音频、图像都接进来;第四,图像和音频带来的隐私与合规问题,和纯文本不是一回事,需要单独设计。
各家模型支持哪些模态、限制如何,以官方页面为准。
