具身智能新手名词表English

掩码自编码器

Masked AutoencoderMAE进阶

遮住图像的大部分小块再让模型补回来,以此自监督学习视觉特征。

掩码自编码器是 Meta FAIR 的何恺明等人 2021 年提出的自监督视觉预训练方法。它把图像切成小块(patch),随机遮住约 75%,编码器只处理可见的块,再由一个轻量解码器根据编码结果重建被遮住的像素。因为编码器只看四分之一的块,训练可加速 3 倍以上;不需要人工标注就能学到好特征,ViT-Huge 在 ImageNet-1K 上达到 87.8% 准确率。机器人领域常用它预训练视觉编码器:MVP 用 MAE 预训练编码器后冻结,用于学习运动控制;VC-1 也采用了 MAE 目标。

例子MVP(2022)用 MAE 在大量真实世界图像上预训练 ViT 编码器,冻结后接强化学习控制器,在一组机械臂操作任务上比监督预训练的编码器成功率最高高出 80 个百分点。

也叫
掩码建模、掩码图像建模
相关
自监督学习、视觉 Transformer、预训练视觉表征、MVP(掩码视觉预训练)、VC-1、表征学习
来源
Masked Autoencoders Are Scalable Vision Learners (arXiv:2111.06377)
Masked Visual Pre-training for Motor Control (MVP, arXiv:2203.06173)

在完整名词表里查看 →