一句话定义:主动学习(Active Learning)是一种训练策略——不让模型被动接受随机标注的数据,而是让它主动挑出"最值得标注"的样本交给人工打标,用更少的标注量换来同等甚至更好的效果。
为什么需要它
监督学习的瓶颈往往不在算法,而在标签。数据本身可能唾手可得,但每条标签都要人来看、人来判断,又贵又慢。随机抽一批标是最省事的做法,问题是里面大量样本模型早就学会了,标了等于没标。
主动学习把顺序倒过来:先用少量数据训一个还不怎么样的模型,让它扫一遍未标注的数据池,挑出自己最拿不准的那些,送去标注,标完再训练,如此循环。每轮只标一小批,把钱花在刀刃上。
打个比方
学生刷题。如果只反复做已经会的题,分数涨得很慢;把整本习题册从头做到尾,又太耗时间。聪明的做法是先做一套摸底卷,找出自己"卡在及格线边缘"的知识点,然后专门练这些。主动学习就是让模型举手说"这道题我不确定",老师再来讲。
怎么判断"不确定"
常见几类挑选策略:
- 不确定性采样(uncertainty sampling):二分类里预测概率最接近 0.5 的样本,模型最迷糊,优先标。
- 委员会查询(query by committee):训练几个有差异的模型投票,分歧最大的样本最值得标。
- 多样性/代表性采样(diversity sampling、core-set):避免只挑长得像的样本,让选出的批次覆盖整体数据分布。
| 维度 | 主动学习 | 随机抽样标注 |
|---|---|---|
| 达到同等效果所需标注量 | 通常更少 | 更多 |
| 选样依据 | 模型不确定性、多样性 | 无,纯随机 |
| 额外开销 | 反复推理、重训,算力成本高 | 几乎为零 |
| 主要风险 | 选样偏差,可能忽视稀有类别 | 覆盖均匀但存在大量冗余 |
和相邻概念的区别
半监督学习(semi-supervised learning)是自己给无标注数据打伪标签,不请人;主动学习的关键恰恰是"请人标,但只标哪些"。课程学习(curriculum learning)安排的是样本进场的先后顺序,从易到难,不涉及人工标注的取舍。数据清洗关注的是剔除脏样本,主动学习关注的是挑出高信息量样本。至于"主动"两个字,和强化学习没有关系。
对实际工作的意义
在医疗影像、法律文书、工业质检这类标注必须由专家完成、单条成本高的场景,主动学习省下的往往是真金白银。落地时有几个坑值得留意:冷启动阶段模型本身很差,"不确定性"判断未必靠谱,通常要先用一批随机样本热身;迭代过程中选样可能有偏差,最好保留一部分随机样本兜底,避免某些类别被彻底忽略。挑选与重训带来的额外算力开销也要算进总账,具体工具选型以官方文档为准。
