跳到主内容
快讯直播
AI智模界
AI 词典

最大似然估计:训练模型为什么在最大化数据概率

一句话定义:最大似然估计(Maximum Likelihood Estimation,MLE)是给定一批已经观测到的数据,反推"哪组参数最有可能产生这批数据"的方法——谁让数据出现的概率最大,就选谁。

一个猜球的比方

盒子里有红蓝两种球,你不知道比例。伸手摸了 10 次(每次放回),8 红 2 蓝。你会怎么猜红球比例?大多数人脱口而出 80%。这就是 MLE 的思路:与其问"红球到底占多少",不如问"红球占多少时,我摸出 8 红 2 蓝这件事最不意外"。把比例记作 θ,出现这组结果的概率是 θ⁸(1-θ)²,求它的最大值,答案正好是 0.8。MLE 不保证猜中真实比例,但它是最"贴合证据"的猜法。

从连乘到损失函数

真实训练时,数据不是 10 次而是几百万条。假设样本彼此独立,整批数据的似然就是每条样本概率的连乘。连乘既容易数值下溢,又不好求导。于是取对数,连乘变连加,得到对数似然;再整体加负号,把"求最大"变成"求最小",就得到负对数似然(Negative Log-Likelihood,NLL)——这正是训练代码里那个 loss。

它和最小交叉熵的关系

交叉熵(Cross-Entropy)衡量两个分布的差距。在分类任务里,真实标签可以看成 one-hot 分布(这条样本 100% 属于第 3 类),此时交叉熵化简为 −log(模型给正确类别的概率)。把整个数据集上的这个量取平均,就是平均负对数似然。所以:最小化交叉熵 = 最大化似然,两者只差一个负号和常数因子,不是"两套方法",而是同一件事的两种叫法。回归任务同理,若假设误差服从高斯分布,MLE 推导出来就是最小化均方误差(MSE)。

方法在最大化什么一句话区别
MLEP(数据 \参数)只看证据,不管先验偏好
MAP(最大后验)P(参数 \数据)加上先验,等价于 MLE + 正则化
贝叶斯推断整个后验分布不取单点,给出不确定性

对做模型的人意味着什么

第一,数据质量直接决定上限。MLE 会认真拟合每一条标签,包括标错的那些,所以噪声标签比数据量不足更致命。第二,过拟合有了直觉解释:模型把所有参数自由度都用来抬高训练数据的似然,连噪声的"偶然形状"也照单全收。第三,L2 正则之所以能抗过拟合,从 MAP 角度看就是给参数加了高斯先验,把纯 MLE 往"别太极端"的方向拉了一把。第四,看到损失函数里那些 log,不必觉得神秘——它们只是把连乘改写成好算、好求导的形式。

具体框架用哪个损失函数、参数怎么配,以对应官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。