跳到主内容
快讯直播
AI智模界
AI 词典

JEPA:在抽象表征里做预测,而不是重建像素

JEPA(联合嵌入预测架构,Joint AI 词典:Embedding">Embedding Predictive Architecture)是一种"不在原始数据上重建、只在抽象表征上做预测"的自监督学习架构,由 Yann LeCun 等人提出并推动。

它预测什么

主流生成式模型——大语言模型、扩散模型——本质上都在做重建:给一段被遮住的文本,逐 token(词元)吐出原文;给一张加噪图片,逐像素还原。连本就无法预测的细节也要算清楚,比如树叶被风吹动的具体形状。

JEPA 换了目标。它有两个编码器(encoder):一个看上下文(视频的前几帧、图片可见的部分),另一个看目标(被遮住的内容)。第一个编码器把上下文压成一组向量,也就是表征(representation);预测器(predictor)结合这组向量和位置信息,去猜第二个编码器会为缺失内容生成什么样的表征。损失只在表征空间计算——比的是两串向量像不像,而不是像素像不像。

打个比方:玩"你画我猜",规则不是让朋友一像素一像素复刻你的画,而是让他在脑子里形成"一只睡着的橘猫"的印象,再说出这个词。JEPA 要的就是印象层面的对齐。树叶怎么飘、雨滴落在哪,这些随机细节在表征里本就模糊,不必预测。

为什么难做

如果两个编码器完全一样、又只要求预测得准,模型会偷懒:把所有输入都编码成同一个常数向量,误差为零,却什么也没学到。这叫表征塌缩(representation collapse)。所以 JEPA 类方法采用非对称设计——目标编码器用滑动平均更新,或对目标侧做梯度截断,让两边不能同时朝偷懒方向跑。

与相邻概念的区别

方法预测空间是否生成细节
自回归/扩散生成模型token、像素全部生成
掩码自编码器(MAE)像素生成被遮部分
对比学习表征不生成,靠正负样本
JEPA(如 I-JEPA、V-JEPA)表征不生成

对比学习也在表征空间工作,但靠"拉近正样本、推远负样本",需要精心构造负样本;JEPA 直接预测目标的表征,不依赖负样本,更适合视频这类时序任务。

对你意味着什么

对从业者,JEPA 是"预测下一个 token"之外的另一条路线:先学世界的抽象结构,再谈生成。它在视频理解、机器人规划等"预测接下来会发生什么"的场景里有天然优势,因为世界模型要抓的是不变的东西,而不是画出每个像素。

对普通人,短期内不必期待一个 JEPA 聊天助手取代现有产品。它目前主要在视觉与表征学习研究中推进,通用语言能力不是它的主场。它更像一种思路上的提醒:理解世界未必需要复刻世界,抓住要点就够了。具体进展请以官方论文与项目页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。