跳到主内容
快讯直播
AI智模界
AI 词典

模态对齐:让文字和图片说同一种话

模态对齐(Modality AI 词典:Alignment">Alignment),指的是让不同模态的数据——文字、图片、声音——在模型内部被映射到同一个语义空间里,使得"含义相同的东西"在这个空间里挨得很近。

为什么需要对齐

文本是离散的符号序列,图片是像素网格,音频是波形采样。三种东西形态毫无共同之处,模型没法直接比较。于是常见做法是各配一个编码器(encoder),分别把它们压成向量。

问题是,如果两个编码器各练各的,出来的向量就活在两套坐标系里:文本向量说"猫"在 (0.8, 0.1),图像向量说这张猫图在 (0.2, 0.9),两个数字毫无关系,算距离也没有意义。

对齐要解决的就是这件事:让它们在同一个坐标系里表达同一个意思。

怎么做到

最常用的思路是对比学习(contrastive learning)。拿一大批成对的图文——网页上图片配的说明文字、商品图和商品标题——送进模型。训练目标很直白:配对的图文向量互相拉近,不配对的推远。反复成千上万次之后,文本编码器和图像编码器就被"逼"出了一套共用的坐标习惯。之后看到一只猫的照片和"一只猫"这句话,两个向量在空间里的位置就会贴在一起。

打个比方:两个科室各有一套档案编号,一个用"A-001",一个用"图-甲-3"。你要查"同一份文件",得先翻两本对照表。对齐做的事,是重新制定一套统一坐标——以后不管从哪个科室进门,同一份文件都落在同一个格子里。

容易混的几个词

概念关心什么一句话
模态对齐表示空间把不同模态映射到同一个语义坐标
多模态融合信息交互在同一个空间里让模态互相"看见"、共同推理
AI 对齐(AI Alignment)目标与价值观让模型行为符合人类意图,与模态无关

前两个是流水线上的先后关系:先对齐,再融合。第三个只是重名,别混。

它的实际意义

对齐是多模态模型真正意义上的第一步。它做得好不好,直接决定零样本分类、图文检索、以图搜商品、文生图这些任务的天花板——因为后面接再大的融合模块,也无法从两套互不相干的坐标系里读出正确信息。

对普通人来说,它就是"你用说话的方式找图,系统真能找对"背后那件看不见的事。至于各家模型具体怎么实现、效果如何,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。