一句话定义:归纳偏置(Inductive Bias)是模型在还没看任何数据之前,由架构自带的“偏好假设”,它决定模型更容易学到哪一类规律。
学习本质上是从有限样本猜全体规律。可猜的规律无穷多,如果没有任何偏好,模型就无法泛化。就像教小孩认猫:只看过几只橘猫,他可能得出“猫都是橘色”;如果大人提醒“看耳朵和脸型”,他就换了一套假设。归纳偏置就是这套事先塞进去的假设。
不同架构的天生偏好不同:
| 架构 | 天生更相信什么 | 生活化说法 |
|---|---|---|
| 多层感知机(MLP) | 特征可任意组合,没有明显空间或顺序假设 | 一张白纸 |
| 卷积神经网络(CNN) | 局部像素更相关,物体平移后仍是同一类 | 看局部花纹,搬家还认得 |
| 循环神经网络(RNN) | 顺序和时间依赖很重要 | 按时间顺序读故事 |
| Transformer | 任意位置都能互相关注,但顺序感要额外注入 | 所有人自由发言,但得发座位号 |
| 决策树 | 用特征阈值做轴对齐切分 | 玩二十问 |
关键是:训练能调参数,却改不掉架构的偏好。给 CNN 足够多数据,它也能学到一些全局关系,但默认仍偏爱局部模式。Transformer 做图像时,通常要把图切成小块并加位置编码,等于人工补上空间先验。这里的“偏置”不是社会偏见,而是统计学习里的偏好和约束。
它和几个相邻概念不同:偏差-方差里的偏差(bias)指模型平均预测与真实值的差距;归纳偏置范围更大,是对假设空间的约束。贝叶斯先验(prior)通常是显式的概率分布;归纳偏置可以是隐式的架构约束。过拟合是训练结果,而归纳偏置会影响模型是否容易过拟合。
实际意义:选架构前先问“数据的规律和谁的偏好匹配”。小数据、强规律任务更依赖归纳偏置;大数据能弱化偏置,但不会让它消失。普通人也能理解:同一任务不同模型表现不同,不全是数据或算力问题,架构天生“愿意相信什么”从一开始就不同。具体实现细节以官方页面为准。
