一句话定义:完全自训练(Fully Self-Training)是指不拿现成的开源权重当起点、也不靠大模型的输出去"教"小模型,而是从数据采集清洗、配比,到词表(tokenizer)、网络结构、预训练与后训练对齐,全流程自己搭、自己训,最终得到一个能力完整的模型。
先澄清一次术语撞车:学术文献里的 self-training 多指半监督学习中的做法——模型给无标注数据打伪标签(pseudo-label),再拿回来继续训。中文语境里说的"完全自训练",重点落在另一头:全链路自己来,不从别人的权重或数据上搭便车。
打个比方
- 蒸馏微调(distillation / fine-tuning):买半成品菜回家加热,十分钟上桌,但味道的上限由别人定。
- 增量预训练(continued pre-training):在别人盖好的楼里做改造,能住得更舒服,但承重墙和管线不是你的,改到深处就动不了。
- 完全自训练:从打地基开始自己盖楼。慢、贵,但户型、层高、以后加不加电梯,自己说了算。
要自己干的活有哪些
数据这层最重:语料从哪来、怎么去重清洗、质量怎么分级、中英文与代码各占多少——这套配比(data mixture)是核心 know-how,抄不走。再往上,词表决定中文和多语言被切成多少 token,直接影响推理成本和长上下文;训练配方决定大集群能不能稳住(损失突然飙升怎么办);最后是后训练(SFT、偏好对齐、工具调用)和一套自己的评测闭环。
和相邻路线比
| 维度 | 完全自训练 | 增量预训练 | 蒸馏微调 |
|---|---|---|---|
| 起点 | 随机初始化 | 已有权重 | 已有模型+教师输出 |
| 投入 | 算力与数据工程最重 | 中 | 轻 |
| 见效速度 | 慢 | 中 | 快 |
| 可控性 | 全流程可控 | 受底座架构与词表限制 | 受底座与教师双重限制 |
| 数据主权 | 完全自有 | 混合 | 常依赖教师侧数据 |
实际意义
对从业者:听到"自研模型",值得追问三句——权重是不是从头训的?训练数据里掺没掺教师模型的输出?词表和架构是不是自己的?很多"自研"其实是在开源权重上做增量预训练或微调,这本身不丢人,但别混为一谈。
对普通人:走这条路的供应商,长期能给的是定制与合规上的自由度——私有数据能进训练、模型大小可以按推理预算来定;代价是初期能力未必追得上头部,换供应商时的迁移成本也更高。
最近围绕智谱下一代 GLM 的剧透,传递的差不多就是这个信号:重点不在这次跑分高了多少,而在能力上限和迭代节奏握在自己手里。具体细节以官方发布为准。
