一句话说:实验追踪(Experiment Tracking)是把每一次模型训练当成一次可回查的实验,记录参数、数据、代码、环境和结果,让你事后能回答"这个结果是怎么跑出来的"。
打个比方:你在厨房试了二十次番茄炒蛋,第二十三次终于好吃到爆,可你没记配方——鸡蛋三个还是四个?糖放了没有?下次想复现只能靠猜。模型训练更麻烦:跑了三十轮,指标最好的是哪次?是改了学习率,换了数据清洗规则,还是只换了个随机种子?没有记录,答案全靠脑补。
实验追踪要记的,是复现一次训练所需的"最小信息集合":
- 超参数(Hyperparameter):学习率、批大小、训练轮数
- 数据版本:用哪一版数据、怎么切分
- 代码版本:对应的代码提交
- 环境与随机种子:依赖、硬件、seed
- 指标曲线:损失、准确率随训练的变化
- 产物:模型权重、日志、预测样例存在哪
记完还不算完,关键是能横向比较:把所有实验放进一张表,按指标排序、按参数筛选,一眼看出"哪次改动真有用"。常见做法是用 MLflow、Weights & Biases、TensorBoard 这类工具,具体功能以官方页面为准。
它和相邻概念容易混:
| 概念 | 管什么 | 回答的问题 |
|---|---|---|
| 版本控制(Git) | 代码变更史 | 代码改了什么 |
| 日志/看板 | 单次训练的输出 | 这次训练现在怎么样 |
| 实验追踪 | 多次训练的上下文与结果 | 哪个方案更好、为什么 |
| 模型注册(Model Registry) | 最终模型的上线与版本 | 线上该用哪个 |
Git 管代码,日志管当下,实验追踪管"试过什么",模型注册管"最终用哪个"。
对从业者,它省时间、少扯皮:复现好结果不用翻聊天记录,交接项目不用口头传功,写报告能直接拿出对比表。对普通职场人,这套思路同样适用——做 A/B 测试、调投放策略,只要记下"当时改了什么、结果如何",复盘才不会变成讲故事。
一句提醒:记录的标准不是越全越好,而是"别人拿这份记录,能不能重跑一遍"。
