跳到主内容
快讯直播
AI智模界
AI 词典

能量模型:用「能量高低」描述世界

一句话定义

能量模型(Energy-Based Model,EBM)是一类不直接输出概率、而是给每一种「可能的配置」打一个能量分数的模型:能量越低,这个配置越合理。

原理:把世界画成一张地形图

假设你要判断一张图、一句话或一个动作是否「像真的」。一般模型会让你算概率 p(x),能量模型则只给你一个数 E(x)——能量。二者通过一个简单关系挂钩:能量越低,概率越大,大致是 p(x) 正比于 exp(−E(x))。

可以把它想成一张地形图:每个可能的样本都是地图上的一个点,山谷是低能量区(合理样本密集),山峰是高能量区(荒谬样本)。模型训练的过程,就是把真实数据的点「压」进山谷,把乱来的点「抬」到山上。生成新样本,就是从山上随便丢一个球,让它顺着坡滚下去,最后停在山谷里——这个过程在数学上叫采样。

它和邻居们的区别

输出什么能不能直接算出概率
自回归模型、归一化流每个样本的概率能
能量模型每个样本的能量通常不能
AI 词典:生成对抗网络">生成对抗网络(GAN)真/假判别信号不显式给

麻烦就出在「通常不能」。要把能量换成概率,得除以一个归一化常数(配分函数,partition function),也就是整张地形图的「总面积」。这个量需要对所有可能的样本求和,在图像、文本这种高维空间里根本算不完。所以能量模型发明了一堆绕路办法:不去算概率本身,而是算概率对输入的梯度(叫分数,score),它恰好等于能量梯度的相反数;再用马尔可夫链蒙特卡洛(MCMC)之类的方法在地形上「滚球」。

和扩散模型到底什么关系

关系很近。扩散模型(Diffusion Model)每一步学的「往哪个方向去噪」,本质上就是在估计数据密度的分数,也就是能量的负梯度。也就是说,扩散模型不告诉你能量是多少,只告诉你山坡朝哪边下降。它做的采样,可以理解成把一次困难的 MCMC 滚球,拆成几十上百个小碎步,每一步都好学也好走。所以业内常把扩散模型看作一类「隐式的、被驯化过的能量模型」——同一种世界观,换了一套更稳的训练和采样方式。

对从业者的意义

能量模型最大的价值是统一视角:分类可以看成给正确类别更低的能量;强化学习里奖励取负号就是能量;约束、格式要求、安全规则,都能写成一个个能量项,叠加起来「引导」输出往某个方向走。做生成、做推理时搜索、做可控性的人,脑子里有一个能量地形图,会比只盯着概率分布更容易想清楚「我该怎么把模型推向我要的结果」。

需要提醒的是,具体实现和工具链更新很快,选型时以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。