跳到主内容
快讯直播
AI智模界
AI 词典

CLIP:让图片和文字落在同一张地图上

一句话定义:CLIP(Contrastive Language–Image Pre-training,对比语言-图像预训练)用海量图文对做对比训练,把图片和文字映射到同一个嵌入空间,让两者能互相检索、互相打分。

原理:想象一场大型相亲会。每张图片和它对应的文字是一对“官方配对”。模型用图像编码器、文本编码器分别把图片和文字变成向量坐标,然后把所有图片和文字放进同一张“地图”。训练目标是:官方配对的坐标互相靠近,非配对的坐标互相远离。这就是对比学习(contrastive learning)——不背答案,而是学会“谁和谁更像”。

训练好后,它有两个直接用途。检索:输入“一只在草地上奔跑的柯基”,把这句话变成坐标,去找最接近的图片;反过来,给图找描述也一样。打分:给一张图和一句文字,算相似度,判断有多搭。因为监督信号是自然语言,CLIP 还能做零样本分类(zero-shot classification):不用为新类别重训,只要把类别写成句子,比如“一张猫的照片”“一张狗的照片”,比哪个分数高。

和相邻概念的区别:

  • 传统图像分类模型只认识训练时固定的类别,换类别常要重训;CLIP 用文字当类别,更开放。
  • 文生图等生成模型负责“画出来”;CLIP 更像“裁判/检索器”,负责判断图文是否匹配、给结果打分,本身不生成图片。
  • 多模态大模型能对话和推理;CLIP 更专注图文对齐,常作为视觉与语言之间的基础组件。

实际意义:从业者可以用它做以文搜图、以图搜文、推荐召回、内容审核、图文数据清洗,也能给生成模型做匹配度打分。对普通人,搜索框不只会匹配关键词,还能理解画面和自然语言描述。它的边界是:擅长整体语义匹配,不擅长细粒度计数、空间关系和复杂推理;训练数据中的偏见也可能被带进结果。具体能力以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。