一句话定义:持续预训练(Continual Pre-Training,CPT)是在一个已经练好的基础模型上,用新领域的原始文本继续做自监督训练,把新知识写进模型的参数里。
原理:还是"猜下一个词",只是换了教材
大模型的预训练目标很朴素——给一段文本,猜下一个词是什么。喂进去的是海量无标注文本,没人标答案,所以叫"自监督"。持续预训练沿用这个目标,只把语料换掉:换成医学论文、法律条文、某行业的内部文档,或者一种模型原本不擅长的语言。
打个比方:基础模型像个刚毕业的本科生,通识不错但不懂你们行业。CPT 就是让他再去读一个第二学位——还是靠自己读书自学,不是老师出题考试。读完之后,他确实懂行了,但也可能把大学里学的数学和英语忘掉一大半。这就是AI 词典:灾难性遗忘">灾难性遗忘(Catastrophic Forgetting)。
和相邻概念的区别
| 维度 | 持续预训练 CPT | 监督微调 SFT | 检索增强 RAG |
|---|---|---|---|
| 喂什么 | 无标注的领域文本 | 指令—回答配对数据 | 外部知识库文档 |
| 学到什么 | 领域知识与语言分布 | 行为方式、格式、指令跟随 | 权重不变,只借资料 |
| 更新成本 | 高 | 中 | 低,改库即可 |
| 主要风险 | 灾难性遗忘 | 过拟合、能力偏科 | 检索不准、上下文超长 |
关键要分清:监督微调(Supervised Fine-Tuning,SFT)教的是"怎么回答",CPT 教的是"知道什么"。RAG 则是把知识放在模型外面,用的时候检索进来,权重一动不动。
和持续学习(Continual Learning)也不是一回事。持续学习是一整类研究问题——怎么在学新任务时不忘记旧任务,方法包括回放旧数据、约束参数、隔离网络分支等。CPT 只是一个具体动作,它天然容易触发遗忘,所以常借持续学习里的办法来兜底。
最容易踩的坑
灾难性遗忘的典型症状:模型开始满口领域黑话,通用问答变差,连"帮我写封邮件"这种简单指令都执行不利索——因为参数被新语料拽离了原来的分布。常见缓解手段:新语料里掺一部分通用语料做回放;学习率调小、步数别贪;用 LoRA(Low-Rank Adaptation)这类参数高效方法只动一小部分参数;每个阶段都留一组通用能力测试题做回归。另外,CPT 之后通常要再补一轮指令微调,否则之前对齐好的行为会被冲淡。
对从业者意味着什么
CPT 是"把通用模型变成行业模型"的常规路线,适合领域语料足够多、且知识相对稳定的场景,比如医疗、法律、金融、工业。要不要做,可以先问三个问题:这批知识稳定吗?量够大吗?检索能解决吗?如果只有几百份文档,RAG 通常更划算。
对普通人来说,你在某个产品里见到"特别懂我们这行"的模型,背后很可能就是 CPT 加后续微调。也提醒一句:知识进的是权重,就有时间点,之后的新变化照样得再更新一轮。
具体语料配比、学习率等设置,以所用训练框架和官方文档为准。
