跳到主内容
快讯直播
AI智模界
AI 词典

变分推断:用优化代替积分的通用思路

一句话定义:变分推断(Variational AI 词典:Inference">Inference,VI)是一种近似推断方法,它把"算不出来的积分"改写成"调得动的优化问题",用梯度下降去找一个最接近真实答案的简单分布。

它到底在解决什么

贝叶斯方法的核心问题是求后验分布:看到数据后,隐变量(比如一张图的主题、一句话的语义)长什么样?数学上它等于"似然 × 先验"再除以一个归一化常数(证据)。麻烦就在这个常数——它是一个对全部隐变量的积分,除了极少数教科书模型,基本没有解析解,高维下也没法暴力数值积分。

变分推断的思路是认怂:既然真后验拿不到,那就自己挑一个"好算"的分布族,比如各维独立的高斯分布,记作 q(z),然后调整它的参数,让它尽量贴近真后验。衡量"贴近"用 KL 散度(KL divergence)。但直接最小化 KL 又会碰到那个算不出的常数,于是等价地转成最大化一个叫 ELBO(Evidence Lower Bound,证据下界)的目标:

ELBO = 期望的对数似然 − q 与先验的 KL 散度

这两项都能用采样估计、用梯度优化。于是"积分难题"变成了"调参数难题"。

打个比方:精确推断像把整片森林的树一棵棵数清楚;变分推断则是先假定"树大致成片分布",只调几个参数,让模型画出的分布图尽量贴近真实照片。你放弃了逐棵精确,换来的是可计算、可扩展。

实践中常加一个平均场(mean-field)假设:认为 q 的各维相互独立,这样计算大幅简化,代价是低估不确定性、可能忽略维度间的相关性。

和相邻概念的区别

方法思路特点
精确推断解析求积分只有极少数模型可行
MCMC 采样反复采样逼近真实分布渐近精确,但慢、难判断收敛
变分推断找最像的分布,做优化快、可扩展、可嵌入神经网络,但有系统性偏差

和 EM 算法(Expectation-Maximization)的关系也值得一说:EM 的 E 步要求精确算期望,一旦算不出来就卡住;变分推断相当于"E 步用近似分布顶上",是 EM 的自然推广。

为什么它能撑起 VAE 和扩散模型

自编码器">变分自编码器(VAE)的损失函数就是 ELBO,编码器输出的正是 q 的参数;重参数化技巧(reparameterization trick)让随机采样也能回传梯度,整套模型才能端到端训练。

扩散模型的目标同样可以写成数据对数似然的一个变分下界:加噪过程定义了隐变量的生成链,去噪网络则在近似每一步的后验。所以它骨子里还是"用优化代替积分"。

对从业者的意义

  • 遇到"目标函数里有个算不出的归一化项",先想能不能改成变分下界。
  • 理解 VAE 的模糊输出、模式坍塌,以及为什么很多生成模型是近似而非精确,都绕不开 VI 的偏差来源。
  • 对普通人,它的启发是通用的工程哲学:精确解求不到时,定义一个可度量的"够像",然后朝着它迭代。

具体实现细节与最新进展,以官方文档和论文原文为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。