跳到主内容
快讯直播
AI智模界
AI 词典

自监督学习(Self-Supervised Learning):让数据自己出题

一句话定义:自监督学习是一种不靠人工标注、而是从数据本身「造」出预测任务来训练模型的方法——标签不是人贴的,是从原始数据里顺手挖出来的。

把答案藏在题目里

想象你给孩子一本没有练习册的故事书。你想让他学会语言,但没时间给每句话写注释。怎么办?简单:把句子里的某个词涂黑,让他猜。

「今天天气真___,我们去公园吧。」答案是原文里的「好」,涂黑之前抄一份就行。孩子猜错了,对照原文改;猜对了,继续下一句。整个过程没有任何人写注释,却产生了成千上万道带标准答案的题。

自监督学习就是这么干的。文本模型挡住一个词让模型猜(AI 词典:掩码语言建模">掩码语言建模,Masked Language Modeling),或者让它预测下一个词;图像模型挡掉一块像素让它补全,或者拿同一张图的两个裁剪版本,要求模型认为它们是「同一个东西」(对比学习Contrastive Learning)。语音、视频、用户行为序列也都能这么玩:预测下一帧、下一次点击、下一笔交易。

和几个近亲的区别

范式标签从哪来典型任务主要用途
监督学习人工标注分类、检测有明确目标、标注可控
无监督学习没有标签聚类、降维找数据内在结构
自监督学习从数据自身生成掩码预测、下一项预测、对比预训练通用表征
强化学习环境给的奖励决策、控制序列决策

关键差别在两处:无监督学习通常只是发现结构,不一定产生能迁移到下游任务的表征;自监督学习则明确构造「输入—目标」对,本质仍是监督学习,只是标签自动化了。

对从业者的意义

第一,规模上限被抬高了。人工标注贵、慢、有上限,而互联网上的文本、图片、日志几乎是无限的。大语言模型能用海量语料预训练,靠的就是「下一个词预测」这种零成本任务。

第二,它产出的是通用表征。预训练好的模型稍加微调甚至直接提示,就能干很多没专门训练过的事。所以实际项目里的顺序往往不是「先标数据再训模型」,而是「先用现成预训练模型试试,不够再补少量标注」。

第三,做垂直领域时值得问一句:我手里的原始数据能不能自己出题?比如用户行为日志可以预测下一个动作,工单文本可以遮挡关键词让模型复原。能出题,就有机会在标注很少的情况下拿到不错的表示。

具体的模型选型、开源许可和可用版本,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。