一句话定义:最大后验估计(Maximum A Posteriori, MAP)是在看到数据后,选一个让“后验概率”最大的参数值作为估计。它等于在AI 词典:最大似然估计">最大似然估计上乘一个先验,做一次加权折中。
先看最大似然估计(Maximum Likelihood Estimation, MLE):只问“哪个参数最能解释我手上的数据”。比如抛硬币 3 次全是正面,MLE 会认为正面概率是 1。数据太少时,这种估计很容易走极端。
MAP 多问一句:“在看数据之前,我本来觉得参数应该长什么样?”这就是先验(prior)。用公式说:
后验 ∝ 似然 × 先验
取对数后:
log 后验 = log 似然 + log 先验
所以最大化后验,等于在最大化似然的同时,再加一项“先验得分”。这一项在工程上常常就是正则项。
打个比方:找钥匙。MLE 只根据“你最后在哪见过钥匙”来找,哪个位置最能解释线索就去哪。MAP 还会考虑你平时放钥匙的习惯——大概率在门口挂钩。线索很弱时,习惯(先验)主导;线索很强时,现场证据主导。先验越强,估计越偏向先验。比如先验认为硬币通常接近公平,那么 3 次全正面时,MAP 不会直接给出 1,而是往 0.5 拉一点;如果先验非常强,就拉得更多。
这也是 MAP 和 MLE 的关键区别:MLE 没有先验,完全由数据决定;MAP 有先验,是数据和先验的折中。数据越多,似然越强,先验影响越小,MAP 会趋近 MLE。
| 概念 | 优化目标 | 是否用先验 | 结果特点 |
|---|---|---|---|
| MLE | log 似然 | 否 | 数据少时易过拟合、走极端 |
| MAP | log 似然 + log 先验 | 是 | 更稳,但先验太强会带偏 |
| 完整贝叶斯推断 | 整个后验分布 | 是 | 能表达不确定性,计算通常更重 |
还要注意:MAP 是点估计,只给一个参数值;完整贝叶斯推断(Bayesian inference)保留整个后验分布。MAP 取的是后验分布的众数,不一定是后验均值。
对 AI 从业者来说,MAP 是理解正则化的钥匙。高斯先验(Gaussian prior)对应 L2 正则,拉普拉斯先验(Laplace prior)对应 L1 正则;先验方差越小,等价于正则越强,参数越被拉向先验中心。小样本、冷启动、稀疏建模时,先验能防止过拟合;但先验太强也会欠拟合。实际调参时,正则强度往往就是在调“先验有多强”,具体实现以所用框架文档为准。
