掩码自编码器
Masked AutoencoderMAE进阶遮住图像的大部分小块再让模型补回来,以此自监督学习视觉特征。
掩码自编码器是 Meta FAIR 的何恺明等人 2021 年提出的自监督视觉预训练方法。它把图像切成小块(patch),随机遮住约 75%,编码器只处理可见的块,再由一个轻量解码器根据编码结果重建被遮住的像素。因为编码器只看四分之一的块,训练可加速 3 倍以上;不需要人工标注就能学到好特征,ViT-Huge 在 ImageNet-1K 上达到 87.8% 准确率。机器人领域常用它预训练视觉编码器:MVP 用 MAE 预训练编码器后冻结,用于学习运动控制;VC-1 也采用了 MAE 目标。
例子MVP(2022)用 MAE 在大量真实世界图像上预训练 ViT 编码器,冻结后接强化学习控制器,在一组机械臂操作任务上比监督预训练的编码器成功率最高高出 80 个百分点。
- 也叫
- 掩码建模、掩码图像建模
- 相关
- 自监督学习、视觉 Transformer、预训练视觉表征、MVP(掩码视觉预训练)、VC-1、表征学习
- 来源
- Masked Autoencoders Are Scalable Vision Learners (arXiv:2111.06377)
Masked Visual Pre-training for Motor Control (MVP, arXiv:2203.06173)