跳到主内容
快讯直播
AI智模界
AI 词典

完全自训练(Fully Self-Training):不买半成品菜,从打地基开始盖楼

一句话定义:完全自训练(Fully Self-Training)是指不拿现成的开源权重当起点、也不靠大模型的输出去"教"小模型,而是从数据采集清洗、配比,到词表(tokenizer)、网络结构、预训练与后训练对齐,全流程自己搭、自己训,最终得到一个能力完整的模型。

先澄清一次术语撞车:学术文献里的 self-training 多指半监督学习中的做法——模型给无标注数据打伪标签(pseudo-label),再拿回来继续训。中文语境里说的"完全自训练",重点落在另一头:全链路自己来,不从别人的权重或数据上搭便车。

打个比方

  • 蒸馏微调(distillation / fine-tuning):买半成品菜回家加热,十分钟上桌,但味道的上限由别人定。
  • 增量预训练(continued pre-training):在别人盖好的楼里做改造,能住得更舒服,但承重墙和管线不是你的,改到深处就动不了。
  • 完全自训练:从打地基开始自己盖楼。慢、贵,但户型、层高、以后加不加电梯,自己说了算。

要自己干的活有哪些

数据这层最重:语料从哪来、怎么去重清洗、质量怎么分级、中英文与代码各占多少——这套配比(data mixture)是核心 know-how,抄不走。再往上,词表决定中文和多语言被切成多少 token,直接影响推理成本和长上下文;训练配方决定大集群能不能稳住(损失突然飙升怎么办);最后是后训练(SFT、偏好对齐、工具调用)和一套自己的评测闭环。

和相邻路线比

维度完全自训练增量预训练蒸馏微调
起点随机初始化已有权重已有模型+教师输出
投入算力与数据工程最重
见效速度
可控性全流程可控受底座架构与词表限制受底座与教师双重限制
数据主权完全自有混合常依赖教师侧数据

实际意义

对从业者:听到"自研模型",值得追问三句——权重是不是从头训的?训练数据里掺没掺教师模型的输出?词表和架构是不是自己的?很多"自研"其实是在开源权重上做增量预训练或微调,这本身不丢人,但别混为一谈。

对普通人:走这条路的供应商,长期能给的是定制与合规上的自由度——私有数据能进训练、模型大小可以按推理预算来定;代价是初期能力未必追得上头部,换供应商时的迁移成本也更高。

最近围绕智谱下一代 GLM 的剧透,传递的差不多就是这个信号:重点不在这次跑分高了多少,而在能力上限和迭代节奏握在自己手里。具体细节以官方发布为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。