一句话定义:弹性权重巩固(Elastic Weight Consolidation, EWC)是一种持续学习(continual learning)方法——在学新任务时,给"对旧任务很重要"的模型权重套上一根弹簧,把它们往旧数值上拉,从而缓解AI 词典:灾难性遗忘">灾难性遗忘(catastrophic forgetting)。
展开讲原理
先把问题说清楚。一个训练好的神经网络,直接在全新数据上继续微调(fine-tuning),往往新任务学会了,老本行却垮了——这就是灾难性遗忘。原因很简单:梯度下降只管让当前这批数据的损失变小,权重往哪儿漂它并不在乎,而旧任务的知识恰恰散布在这些权重里。
EWC 的做法是往损失函数里加一项惩罚:
总损失 = 新任务损失 + λ · Σ Fᵢ (θᵢ − θᵢ*)²
其中 θᵢ* 是旧任务训练结束时第 i 个权重的值,Fᵢ 是这个权重的重要性(用费舍尔信息矩阵,Fisher Information Matrix 来估计),λ 是整体强度。惩罚项的意思很直白:偏离旧值就要付出代价,越重要(Fᵢ 越大)代价越高。
打个比方:一栋老房子要改造。承重墙动了整栋楼会塌,于是给你加上一根很硬的弹簧,你一推就被弹回原位;而那些隔断、装饰墙无关紧要,弹簧几乎不存在,随便拆随便改。EWC 只做一件事——判断哪些权重是承重墙(Fᵢ 大),哪些是装饰墙(Fᵢ 小),然后区别对待。
关键在于,EWC 不需要保存旧任务的数据。它只要存下旧参数 θᵢ* 和一份重要性估计,就能在"看不到昨天的题"的前提下继续学习,这一点对隐私敏感或数据无法留存的场景很有价值。
和相邻概念的区别
| 方法 | 是否需要旧数据 | 约束方式 | 典型特点 |
|---|---|---|---|
| 直接微调 | 否 | 无 | 忘得最狠 |
| L2 正则 / 权重衰减 | 否 | 所有参数一律拉向原点 | 一视同仁,容易限制新任务学习 |
| EWC | 否 | 按重要性拉向"旧值" | 重要参数冻结、次要参数放开 |
| 回放(Replay) | 是 | 混入旧样本一起训练 | 效果好,但要存数据 |
| 多任务学习 | 是(同时可见) | 联合优化 | 需要一次性拿到全部数据 |
一句话:L2 是给所有参数上手铐,EWC 是只给关键参数上弹簧;回放靠"复习旧题",EWC 靠"别乱动已经学会的部分"。
对从业者的实际意义
模型上线后总要遇到新数据、新场景、新技能。EWC 提供了一种低成本思路:不做全量重训,也不回滚历史数据,而是在增量训练时给重要权重加一道"弹性保护",让新旧能力共存。机器人叠加新动作、推荐系统跟进新品类、端侧模型持续适配用户习惯,都是它的用武之地。
当然它也有边界:任务一多,不同任务争抢同一批权重,弹簧会互相打架;费舍尔信息只是重要性的近似估计,强度 λ 也需要调。实际工程中常见做法是和少量回放、参数隔离等手段组合使用。具体实现细节和超参,以所用框架的官方文档为准。
