跳到主内容
快讯直播
AI智模界
AI 词典

互信息:两个变量到底共享多少信息

一句话定义:互信息(Mutual Information)衡量两个变量共享多少信息——知道其中一个,能让另一个的“不确定性”减少多少。

从熵说起

假设 X 是明天的天气预报,Y 是实际会不会下雨。熵(Entropy)H(X) 表示 X 本身有多不确定;条件熵 H(X|Y) 表示知道 Y 后 X 还剩多少不确定。互信息就是两者之差:

I(X;Y) = H(X) - H(X|Y)

它是对称的:I(X;Y) = I(Y;X)。最小为 0,表示两个变量独立——知道谁都不帮助猜另一个;数值越大,说明依赖越强。

生活化比方:你和同事各自拿着同一幅拼图的一半。碎片本身有多乱,是熵;把两半拼在一起能互相揭示出多少图案,就是互信息。若两半来自不同拼图,怎么拼都对不上,互信息为 0。

为什么容易和相关性混淆

皮尔逊相关系数(Pearson correlation)只测线性关系,而且要求数值变量;互信息捕捉任意统计依赖。比如 Y = X²,当 X 对称分布时相关系数接近 0,但互信息很大。反过来,相关系数为 0 不能推出独立,互信息为 0 才(在估计准确的前提下)意味着独立。另外互信息没有正负、没有方向,单位是比特或奈特。

维度皮尔逊相关性互信息
关系类型线性任意依赖
符号/方向有正负非负、无方向
为 0 的含义无线性关系独立
变量类型数值离散、连续皆可
估计难度较简单需分箱或近邻估计,样本少易高估

实际意义

做特征选择时,常用 mRMR(minimum Redundancy Maximum Relevance)等准则:先挑与标签互信息大的特征,再剔除彼此互信息大、信息重复的特征。相比只看相关系数,它更能抓住非线性特征。决策树里的信息增益,本质就是互信息。自监督和对比学习里的 InfoNCE 等方法,也把“最大化表示与输入之间的互信息”当作目标之一,但要注意:最大化互信息不等于学到所有有用信息,编码器可能偏向容易估计的部分。

对普通人,听到“某指标和某疾病有关”时,可以多想一步:这是线性相关,还是任意依赖?以及相关不等于因果,互信息同样不等于因果。连续变量的互信息估计对方法很敏感,具体实现和参数以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。