跳到主内容
快讯直播
AI智模界
AI 词典

持续预训练:给模型补一门专业课,但别让它忘了通识课

一句话定义:持续预训练(Continual Pre-Training,CPT)是在一个已经练好的基础模型上,用新领域的原始文本继续做自监督训练,把新知识写进模型的参数里。

原理:还是"猜下一个词",只是换了教材

大模型的预训练目标很朴素——给一段文本,猜下一个词是什么。喂进去的是海量无标注文本,没人标答案,所以叫"自监督"。持续预训练沿用这个目标,只把语料换掉:换成医学论文、法律条文、某行业的内部文档,或者一种模型原本不擅长的语言。

打个比方:基础模型像个刚毕业的本科生,通识不错但不懂你们行业。CPT 就是让他再去读一个第二学位——还是靠自己读书自学,不是老师出题考试。读完之后,他确实懂行了,但也可能把大学里学的数学和英语忘掉一大半。这就是AI 词典:灾难性遗忘">灾难性遗忘(Catastrophic Forgetting)。

和相邻概念的区别

维度持续预训练 CPT监督微调 SFT检索增强 RAG
喂什么无标注的领域文本指令—回答配对数据外部知识库文档
学到什么领域知识与语言分布行为方式、格式、指令跟随权重不变,只借资料
更新成本低,改库即可
主要风险灾难性遗忘过拟合、能力偏科检索不准、上下文超长

关键要分清:监督微调(Supervised Fine-Tuning,SFT)教的是"怎么回答",CPT 教的是"知道什么"。RAG 则是把知识放在模型外面,用的时候检索进来,权重一动不动。

持续学习(Continual Learning)也不是一回事。持续学习是一整类研究问题——怎么在学新任务时不忘记旧任务,方法包括回放旧数据、约束参数、隔离网络分支等。CPT 只是一个具体动作,它天然容易触发遗忘,所以常借持续学习里的办法来兜底。

最容易踩的坑

灾难性遗忘的典型症状:模型开始满口领域黑话,通用问答变差,连"帮我写封邮件"这种简单指令都执行不利索——因为参数被新语料拽离了原来的分布。常见缓解手段:新语料里掺一部分通用语料做回放;学习率调小、步数别贪;用 LoRA(Low-Rank Adaptation)这类参数高效方法只动一小部分参数;每个阶段都留一组通用能力测试题做回归。另外,CPT 之后通常要再补一轮指令微调,否则之前对齐好的行为会被冲淡。

对从业者意味着什么

CPT 是"把通用模型变成行业模型"的常规路线,适合领域语料足够多、且知识相对稳定的场景,比如医疗、法律、金融、工业。要不要做,可以先问三个问题:这批知识稳定吗?量够大吗?检索能解决吗?如果只有几百份文档,RAG 通常更划算。

对普通人来说,你在某个产品里见到"特别懂我们这行"的模型,背后很可能就是 CPT 加后续微调。也提醒一句:知识进的是权重,就有时间点,之后的新变化照样得再更新一轮。

具体语料配比、学习率等设置,以所用训练框架和官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。