跳到主内容
快讯直播
AI智模界
AI 词典

最大后验估计(MAP):在最大似然上加先验

一句话定义:最大后验估计(Maximum A Posteriori, MAP)是在看到数据后,选一个让“后验概率”最大的参数值作为估计。它等于在AI 词典:最大似然估计">最大似然估计上乘一个先验,做一次加权折中。

先看最大似然估计(Maximum Likelihood Estimation, MLE):只问“哪个参数最能解释我手上的数据”。比如抛硬币 3 次全是正面,MLE 会认为正面概率是 1。数据太少时,这种估计很容易走极端。

MAP 多问一句:“在看数据之前,我本来觉得参数应该长什么样?”这就是先验(prior)。用公式说:

后验 ∝ 似然 × 先验

取对数后:

log 后验 = log 似然 + log 先验

所以最大化后验,等于在最大化似然的同时,再加一项“先验得分”。这一项在工程上常常就是正则项。

打个比方:找钥匙。MLE 只根据“你最后在哪见过钥匙”来找,哪个位置最能解释线索就去哪。MAP 还会考虑你平时放钥匙的习惯——大概率在门口挂钩。线索很弱时,习惯(先验)主导;线索很强时,现场证据主导。先验越强,估计越偏向先验。比如先验认为硬币通常接近公平,那么 3 次全正面时,MAP 不会直接给出 1,而是往 0.5 拉一点;如果先验非常强,就拉得更多。

这也是 MAP 和 MLE 的关键区别:MLE 没有先验,完全由数据决定;MAP 有先验,是数据和先验的折中。数据越多,似然越强,先验影响越小,MAP 会趋近 MLE。

概念优化目标是否用先验结果特点
MLElog 似然否数据少时易过拟合、走极端
MAPlog 似然 + log 先验是更稳,但先验太强会带偏
完整贝叶斯推断整个后验分布是能表达不确定性,计算通常更重

还要注意:MAP 是点估计,只给一个参数值;完整贝叶斯推断(Bayesian inference)保留整个后验分布。MAP 取的是后验分布的众数,不一定是后验均值。

对 AI 从业者来说,MAP 是理解正则化的钥匙。高斯先验(Gaussian prior)对应 L2 正则,拉普拉斯先验(Laplace prior)对应 L1 正则;先验方差越小,等价于正则越强,参数越被拉向先验中心。小样本、冷启动、稀疏建模时,先验能防止过拟合;但先验太强也会欠拟合。实际调参时,正则强度往往就是在调“先验有多强”,具体实现以所用框架文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。