跳到主内容
快讯直播
AI智模界
AI 词典

主动学习:让模型自己挑题做,标注少而精

一句话定义:主动学习(Active Learning)是一种训练策略——不让模型被动接受随机标注的数据,而是让它主动挑出"最值得标注"的样本交给人工打标,用更少的标注量换来同等甚至更好的效果。

为什么需要它

监督学习的瓶颈往往不在算法,而在标签。数据本身可能唾手可得,但每条标签都要人来看、人来判断,又贵又慢。随机抽一批标是最省事的做法,问题是里面大量样本模型早就学会了,标了等于没标。

主动学习把顺序倒过来:先用少量数据训一个还不怎么样的模型,让它扫一遍未标注的数据池,挑出自己最拿不准的那些,送去标注,标完再训练,如此循环。每轮只标一小批,把钱花在刀刃上。

打个比方

学生刷题。如果只反复做已经会的题,分数涨得很慢;把整本习题册从头做到尾,又太耗时间。聪明的做法是先做一套摸底卷,找出自己"卡在及格线边缘"的知识点,然后专门练这些。主动学习就是让模型举手说"这道题我不确定",老师再来讲。

怎么判断"不确定"

常见几类挑选策略:

  • 不确定性采样(uncertainty sampling):二分类里预测概率最接近 0.5 的样本,模型最迷糊,优先标。
  • 委员会查询(query by committee):训练几个有差异的模型投票,分歧最大的样本最值得标。
  • 多样性/代表性采样(diversity sampling、core-set):避免只挑长得像的样本,让选出的批次覆盖整体数据分布。
维度主动学习随机抽样标注
达到同等效果所需标注量通常更少更多
选样依据模型不确定性、多样性无,纯随机
额外开销反复推理、重训,算力成本高几乎为零
主要风险选样偏差,可能忽视稀有类别覆盖均匀但存在大量冗余

和相邻概念的区别

半监督学习(semi-supervised learning)是自己给无标注数据打伪标签,不请人;主动学习的关键恰恰是"请人标,但只标哪些"。课程学习(curriculum learning)安排的是样本进场的先后顺序,从易到难,不涉及人工标注的取舍。数据清洗关注的是剔除脏样本,主动学习关注的是挑出高信息量样本。至于"主动"两个字,和强化学习没有关系。

对实际工作的意义

在医疗影像、法律文书、工业质检这类标注必须由专家完成、单条成本高的场景,主动学习省下的往往是真金白银。落地时有几个坑值得留意:冷启动阶段模型本身很差,"不确定性"判断未必靠谱,通常要先用一批随机样本热身;迭代过程中选样可能有偏差,最好保留一部分随机样本兜底,避免某些类别被彻底忽略。挑选与重训带来的额外算力开销也要算进总账,具体工具选型以官方文档为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。