跳到主内容
快讯直播
AI智模界
AI 词典

BYOL:不用负样本,也能学出好特征

一句话定义:BYOL(Bootstrap Your Own Latent)是一种不依赖负样本的自监督(self-supervised)表示学习方法——让一个网络去预测自己“慢半拍”的版本的输出,从而学到有用的图像特征。

它是怎么做的

同一张图做两次随机数据增强(裁剪、变色、模糊等),得到两个视图。然后有两个网络:

  • 在线网络(online network):编码器 + 投影头 + 预测器(predictor)
  • 目标网络(target network):编码器 + 投影头,没有预测器

在线网络看视图 A,目标网络看视图 B,训练目标就是让在线网络的输出去预测目标网络对 B 的输出,用均方误差衡量。目标网络的权重不单独训练,而是对在线网络的权重做指数移动平均(EMA, exponential moving average),慢慢跟着走。所以“老师”不是外人,而是学生自己的一个稳定、滞后的影子。

打个比方:你在临摹自己画的一幅画。一只手画得快、爱猜、会改;另一只手画得慢但更稳。你要求快的那只手去画出慢的那只手会画的样子。为了做到这一点,模型不得不在不同裁剪、不同光照下抓住画面里真正不变的东西——物体的本质,而不是噪声细节。

为什么不会“塌掉”

偷懒的解是把所有输入都映射成同一个向量,这叫表示坍塌(collapse)。对比学习靠负样本把不同图片推开,BYOL 没有负样本,靠三个设计避免坍塌:预测器只加在在线网络一侧(结构不对称)、目标网络用 EMA 缓慢更新、输出做归一化。后续研究(如 SimSiam)进一步说明,这种“不对称 + 停梯度”本身就足以撑住训练。

和相邻概念的区别

对比学习需要负样本,拉近正样本、推远负样本;知识蒸馏(knowledge distillation)不需要负样本,但学生模仿的是一个预先训练好的、通常更强的老师;BYOL 两者都不是,它预测的是自己的 EMA 副本。

方法需要负样本核心机制
对比学习(SimCLR、MoCo 等)是拉近正样本、推远负样本
知识蒸馏否模仿已训练好的强老师
BYOL否预测自己的 EMA 目标网络

对从业者的意义

  • 少了大批量的负担。对比学习常常靠很大的 batch 才能凑出足够的负样本,BYOL 不需要,小批量也能训,省显存也省工程。
  • 标签稀缺时好用。先用无标签数据自监督预训练,再用少量标签微调,是医学影像、工业质检这类标注昂贵场景的常见做法。
  • 思想影响更广。它证明了“只预测自己更稳定的表示”也能学到好特征,推动了后续一批非对比自监督方法。

对普通人,可以记住一句话:不必告诉模型“什么是不像的”,只让它不断预测自己更稳定的看法,它照样能抓出事物的共同本质。具体实现细节与最新进展,以官方论文和代码库为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。