跳到主内容
快讯直播
AI智模界
AI 词典

多模态(Multimodality):让模型把文字、图像、声音放进同一套「心智空间」

一句话定义:多模态(Multimodality)指的是让一个模型同时处理文字、图像、音频、视频等不同类型的信息,并把这些信息映射到同一套内部表示里,使它们能互相对照、互相补充、互相生成,而不是各管各的。

从「各管各的」到「共用一套表示」

每一种信息类型,在 AI 里叫一个模态(modality)。过去的做法是「一模态一系统」:OCR(Optical Character Recognition)只管认字,语音识别只管把声音转成文本,图像分类只管给图片打标签。每个系统输出各自的结果,再由人或一堆规则把它们串起来。

多模态的关键动作是对齐(alignment):把一张猫的照片和「一只猫」这句话,投影到同一个共享表示空间(shared embedding space)里,让语义相近的内容距离更近。这样「以文搜图」「以图搜文」「看着截图回答问题」在底层就变成了同一类操作——在这个空间里找最近的邻居,或者把多个模态的向量拼在一起交给后面的模型推理。

打个比方:像一个会议室的同声传译,把中文、英文、手语都翻成同一种「内部语言」,大家才能真正讨论同一件事。另一个比方是图书馆给所有语种的书都编了同一套索引号:你想找「关于孤独的作品」,不管它是中文小说、英文诗集,还是一部没有台词的电影,都能按内容而不是按载体被找到。

技术上,让不同模态互相对话的常见手段是跨模态注意力(cross-attention):处理文字时,模型会回头「看」图像里相关的区域;处理图像时,也会参考文字在说什么。

维度单模态流水线多模态模型
表示方式每种模态一套特征共享表示空间,可互相比较
模态交互靠人工或规则拼接模型内部跨模态注意力
出错形态单点出错,较易定位错误会跨模态传播
典型任务语音转写、图像分类图文问答、截图操作、视频理解

容易混淆的几个邻居

  • 多模态 ≠ 多任务(multi-task):多任务是同一种输入做很多件事;多模态是很多种输入做同一件事或一组事。
  • 多模态理解 vs 多模态生成:理解是把图像、声音变成语义;生成是反过来,把语义变成图像、声音。两者常被放在同一个模型里,但是不同的能力。
  • 能「看到」不等于能「看懂」:模态之间会互相带偏,比如图里有误导性文字时,模型可能顺着文字走,产生跨模态的幻觉

对普通人和从业者意味着什么

对普通人:拍一道题就能问、把会议录音和幻灯片一起丢给助手、用一句话搜出相册里某张照片、给视障用户实时描述眼前的画面,这些体验背后都是多模态在起作用。

对从业者:第一,配对数据(如图文对、音文对)比单模态数据难拿得多,数据质量往往比模型结构更决定上限;第二,评测要分层做——单独测每个模态,再测组合场景,否则很容易出现「单看都行、合起来就崩」;第三,多模态通常更贵更慢,工程上要权衡是否真的需要把音频、图像都接进来;第四,图像和音频带来的隐私与合规问题,和纯文本不是一回事,需要单独设计。

各家模型支持哪些模态、限制如何,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。