具身智能新手名词表English

MVP(掩码视觉预训练)

MVP: Masked Visual Pre-training for Motor Control / Real-World Robot Learning with Masked Visual Pre-trainingMVP进阶

用掩码自编码器在海量自然图像上预训练视觉编码器,再冻结给机器人用。

MVP(Masked Visual Pre-training)指 UC 伯克利 Jitendra Malik、Trevor Darrell 团队的两篇工作:2022 年 3 月的 Masked Visual Pre-training for Motor Control(Tete Xiao 等)在仿真中验证,2022 年 10 月的 Real-World Robot Learning with Masked Visual Pre-training(Ilija Radosavovic 等,CoRL 2022)扩展到真机。做法是先用掩码自编码器(MAE,遮住图像大部分小块让网络补全)在网络图片和第一人称视频上自监督预训练 ViT 视觉编码器,然后冻结编码器,只在上面训练小的控制模块。结果显示这种表征优于 CLIP、ImageNet 监督预训练和从零训练;用 450 万张图训练的 3.07 亿参数 ViT 还能继续提升。它和 R3M、VC-1 一起推动了预训练视觉表征这一方向。

例子把 MVP 预训练好的 ViT 冻结当作机器人的眼睛,只用少量演示训练上面的控制头,就能在新任务上学会抓取。

也叫
掩码视觉预训练、Masked Visual Pre-training
相关
预训练视觉表征、掩码自编码器、自监督学习、R3M、VC-1、视觉 Transformer
来源
arXiv 2203.06173: Masked Visual Pre-training for Motor Control
arXiv 2210.03109: Real-World Robot Learning with Masked Visual Pre-training
信息截至
2022-10

在完整名词表里查看 →