样本效率(Sample Efficiency)指的是:一个模型要学会某个任务,需要多少训练数据。需要的越少,样本效率越高。
人类看两三只猫,模型看几百万张
三岁小孩看过两三只猫,就能认出橘猫、黑猫、趴着的猫、只露半个身子的猫。而一个从随机初始化开始训练的模型,往往要看几万到上百万张标注图片,才能做到差不多的事。差别不在"聪明",而在起点:
- 人不是从零开始。视觉系统、物体恒存、重力直觉这些"先验",是长期积累的结果,孩子学"猫"时只补最后一点点差异。
- 人有很强的归纳偏置(inductive bias),会自动抓住"耳朵形状、胡须、脸型"这类稳定特征;模型没有先验时,只能靠海量样本把噪声平均掉。
- 人一次只看几个样本,但每个样本会被反复"咀嚼";模型通常看一遍就过,只好用数量补。
所以样本效率本质上是在问:你是用数据换性能,还是用先验和算力换性能。大模型时代之所以能"少标注",很大程度是把成本前移到了预训练语料和算力上。
别搞混的几个概念
| 概念 | 它在问什么 |
|---|---|
| 样本效率 | 达到目标效果需要多少条数据 |
| 计算效率 | 需要多少算力、多长时间 |
| 泛化能力 | 换一批没见过的新数据还灵不灵 |
| 少样本学习(few-shot learning) | 一种设定:每类只给几个例子就要学会 |
一句话:少样本学习是"题目",样本效率是"分数"。另外,样本效率高不等于泛化好——靠背题在小数据上刷高分不算本事,得在独立测试集上站得住。
对实际工作的意义
样本效率直接决定小数据场景能不能用:医疗影像、工业质检、稀有故障预警、新业务冷启动,这些场景的标注要么贵、要么根本凑不齐。常见的提升手段有迁移学习与预训练微调、数据增强、AI 词典:自监督学习">自监督学习、元学习(meta-learning),以及把领域知识写进模型结构。
但要记住代价:数据省下来的地方,往往要用算力、预训练语料或更强的假设补回去。数据少也意味着方差大、结果不稳,需要更严格的验证。具体方法是否适用,以官方文档和你们自己的小规模实验为准。
