一句话定义:MAE(Masked Autoencoder,掩码自编码器)是一种自监督视觉预训练方法——把一张图的大部分图块随机遮掉,只让 ViT(Vision Transformer)看到剩下的小部分,再要求它把被遮住的像素重建出来。
先撕掉大半张图,再补回来
做法是先把图像切成固定大小的小方块(patch,图块),例如 16×16 像素一块,然后随机丢掉其中大部分——常见设置是丢掉约 75%,只留约 25% 送进编码器。三个要点:
1. 编码器只看可见块。被遮的位置根本不参与计算,训练开销大致随可见比例缩小,这是它快的核心原因。
2. 解码器负责补全。编码器输出可见块的表示,缺失位置填上可学习的掩码标记(mask token),连同位置信息交给一个轻量解码器,输出被遮区域的像素。
3. 损失主要算在被遮块上,让模型专注"猜缺的东西",而不是照抄已经看见的像素。
打个比方:给你一幅被撕掉四分之三的拼图,只剩几个角,让你补全整幅画。线索太少,靠"照旁边颜色涂"是补不出来的,你必须先推断出"这是一只猫的侧脸"。这种压力逼模型学语义结构,而不是局部纹理。
和相邻概念的区别
MAE 常被拿来和对比学习(contrastive learning)、BERT 比。对比学习判断"两张图是不是同一张的变形",依赖正负样本对;MAE 不做这种判断,直接做像素级重建。它和 BERT 的AI 词典:掩码语言建模">掩码语言建模(Masked Language Modeling, MLM)思路同源,但一个处理连续像素、一个处理离散词元,而且 MAE 的掩码率高得多。
| 维度 | MAE | 对比学习 | BERT 式掩码建模 |
|---|---|---|---|
| 学习信号 | 重建被遮像素 | 样本对相似/不相似 | 预测被遮词 |
| 掩码比例 | 高(常见约 75%) | 无掩码 | 低(常见约 15%) |
| 编码器输入 | 仅可见块 | 完整图像 | 完整序列 |
| 主要开销 | 随可见块数量变化 | 与批次、增强策略关系大 | 全序列都要算 |
对从业者和普通人的意义
对做视觉的工程师,MAE 提供了一条便宜、易放大的预训练路线:不需要人工标注,用海量无标注图片就能练出通用表征,之后接上分类、检测、分割等下游任务的头部再微调。对非技术岗位,它说明了一个大趋势——模型可以先靠"自己给自己出题"变强,标注数据不再是唯一的燃料。具体实现细节与超参数,以官方代码库和论文说明为准。
