一句话定义:中期训练(Mid-training)是夹在预训练和后训练之间的一段继续训练,用更精选、更有针对性的数据,把长上下文能力和领域专长"焊"进模型权重里。
它在流程里的位置
大模型训练大致分三段。预训练(pre-training)喂海量文本,让模型学会语言规律和世界常识;后训练(post-training)用指令数据和偏好数据,教它好好说话、按人类偏好作答;中间那段不常被提起的,就是中期训练。
打个比方
把模型当成一套房子。预训练是盖毛坯房——结构、水电、承重墙都在这时候定,工程量最大,但屋里还是水泥地。后训练是软装——摆家具、调灯光,让房子住着舒服、合客户口味。中期训练则是毛坯交房后的那次改造:扩阳台、重铺管线、按用途重新分区。工程量远小于盖楼,却决定了这套房子最终能装下什么。等家具都摆好了再想砸墙,代价就大了。
它具体在做三件事
拉长上下文。 模型天生只能看到有限长度。想让它读完整本合同、整个代码仓库,就得在这一阶段用长文档继续训,并调整位置编码一类的机制。所以"长上下文"很少是后训练调出来的。
注入领域能力。 医疗、法律、金融、某家公司的内部代码,在通用预训练语料里占比极低。用领域语料做一轮中期训练(不少团队叫持续预训练,continual pre-training),往往比事后堆提示词或做微调更根本。
换数据配比。 把低质量网页换成精选语料,同时把学习率降到很低——这一段常被称为退火(annealing)。此时模型仍处于"吸收"状态,喂什么就长什么。
和相邻阶段的区别
| 阶段 | 数据特点 | 主要目标 | 算力占比 |
|---|---|---|---|
| 预训练 | 海量、来源杂、质量参差 | 掌握语言与世界通用规律 | 绝大部分 |
| 中期训练 | 量少但精,长文本与领域语料为主 | 定长上下文、补领域短板、调配比 | 小得多,但影响大 |
| 后训练 | 指令-回答对、人类偏好数据 | 会听指令、对齐偏好、会对话 | 很小 |
对从业者意味着什么
想做垂直领域模型,从头预训练基本不现实,一次认真的领域中期训练通常性价比最高。判断一个模型能不能干你的活,先看两件事:它吃不吃得下你的长文档,认不认你的行业术语——这两点多半在中期训练就定了,后训练很难补救。
对普通职场人:模型"读得懂整本手册""听得懂你们行话"是这一阶段给的;"说话得体、该拒绝就拒绝"是后训练给的。模型胡编乱造,通常该找后训练或推理环节的问题,不是中期训练的锅。
需要说明的是,这个阶段的命名和边界在各家并不统一,有的干脆把它算作预训练的最后一程,具体口径以各家公开技术文档为准。
