跳到主内容
快讯直播
AI智模界
AI 词典

中期训练:模型能力定型的那段"沉默时光

一句话定义:中期训练(Mid-training)是夹在预训练和后训练之间的一段继续训练,用更精选、更有针对性的数据,把长上下文能力和领域专长"焊"进模型权重里。

它在流程里的位置

大模型训练大致分三段。预训练(pre-training)喂海量文本,让模型学会语言规律和世界常识;后训练(post-training)用指令数据和偏好数据,教它好好说话、按人类偏好作答;中间那段不常被提起的,就是中期训练。

打个比方

把模型当成一套房子。预训练是盖毛坯房——结构、水电、承重墙都在这时候定,工程量最大,但屋里还是水泥地。后训练是软装——摆家具、调灯光,让房子住着舒服、合客户口味。中期训练则是毛坯交房后的那次改造:扩阳台、重铺管线、按用途重新分区。工程量远小于盖楼,却决定了这套房子最终能装下什么。等家具都摆好了再想砸墙,代价就大了。

它具体在做三件事

拉长上下文。 模型天生只能看到有限长度。想让它读完整本合同、整个代码仓库,就得在这一阶段用长文档继续训,并调整位置编码一类的机制。所以"长上下文"很少是后训练调出来的。

注入领域能力。 医疗、法律、金融、某家公司的内部代码,在通用预训练语料里占比极低。用领域语料做一轮中期训练(不少团队叫持续预训练,continual pre-training),往往比事后堆提示词或做微调更根本。

换数据配比。 把低质量网页换成精选语料,同时把学习率降到很低——这一段常被称为退火(annealing)。此时模型仍处于"吸收"状态,喂什么就长什么。

和相邻阶段的区别

阶段数据特点主要目标算力占比
预训练海量、来源杂、质量参差掌握语言与世界通用规律绝大部分
中期训练量少但精,长文本与领域语料为主定长上下文、补领域短板、调配比小得多,但影响大
后训练指令-回答对、人类偏好数据会听指令、对齐偏好、会对话很小

对从业者意味着什么

想做垂直领域模型,从头预训练基本不现实,一次认真的领域中期训练通常性价比最高。判断一个模型能不能干你的活,先看两件事:它吃不吃得下你的长文档,认不认你的行业术语——这两点多半在中期训练就定了,后训练很难补救。

对普通职场人:模型"读得懂整本手册""听得懂你们行话"是这一阶段给的;"说话得体、该拒绝就拒绝"是后训练给的。模型胡编乱造,通常该找后训练或推理环节的问题,不是中期训练的锅。

需要说明的是,这个阶段的命名和边界在各家并不统一,有的干脆把它算作预训练的最后一程,具体口径以各家公开技术文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。