跳到主内容
快讯直播
AI智模界
AI 词典

模型检查点(Checkpoint):训练途中的存档

一句话定义:模型检查点(Checkpoint)是训练过程中每隔一段步数就“另存为”的一份完整训练状态快照,用来断点续训、回退到出问题之前,或者作为后续微调的起点。

为什么一个文件能大到几十 GB

很多人以为检查点里装的就是训练出来的模型参数,那按常理不该那么大。问题就在于:它装的远不止参数。一个典型的训练检查点通常包含三块东西:

1. 模型权重(weights):也就是模型真正“学会”的那堆数字。

2. 优化器状态(optimizer state):如果用的是 Adam 这类优化器,它会给每个参数额外记两份统计量,作为下一步更新的依据。这部分往往比权重本身还大。

3. 训练元数据:当前跑到第几步、学习率调度到哪儿了、随机种子、混合精度用的缩放系数等,缺了这些,续训就接不上。

算一笔粗账:AI 词典:混合精度训练">混合精度训练时,权重往往要留一份低精度副本、一份高精度主副本;优化器再给每个参数配两份高精度状态;再加上梯度。粗算下来,每个参数要占十几到二十个字节以上。参数规模上到十亿量级,一个检查点就是几十 GB 起步,到百 GB 量级也不稀奇。

打个生活化的比方:写长篇小说时,你每隔十页就“另存为”一个新文件。文件里不只有正文,还有你的大纲、人物设定表、改稿记录——因为只有这些东西都在,你才能接着往下写。所以存档比最后出版的成书大得多。成品书就是发布出去用于推理的权重文件,存档则是训练检查点。

和相邻概念的区别

名称存了什么体积量级用途
训练检查点权重 + 优化器状态 + 训练元数据最大续训、回退、做微调起点
发布权重只有权重,常已压缩降精度小很多推理部署
LoRA 适配器只存新增的小矩阵很小低成本定制

关键差异:优化器状态只对“还要继续训练”有用。一旦决定不再训了,这部分就可以丢掉,体积能腰斩甚至更多。这也是为什么同一个模型的检查点和发布版本,下载大小差得离谱。

对从业者和普通人的意义

对训练侧的人来说,检查点频率是个成本权衡:存太勤,磁盘和网络带宽吃不消;存太疏,一次崩溃可能白烧几小时算力。实践上通常会保留“最新的”和“指标最好的”两类,并且保存动作本身要尽量避免阻塞训练。删检查点是个危险操作,删之前先确认最优那份已经落盘。

对普通职场人来说,它解释了两件事:为什么大模型训练这么烧钱——不只是算力,还有海量存储和搬运;以及为什么“下载一个模型”经常是几十 GB 起步的事情,而不是几百 MB 的文件。具体某个框架存了哪些字段、什么格式,各版本会有差异,以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。