具身智能新手名词表English

R3M

R3M: A Universal Visual Representation for Robot Manipulation进阶

用人类第一人称视频预训练、专供机器人操作使用的通用视觉表征

斯坦福与 Meta AI 的 Suraj Nair、Chelsea Finn、Abhinav Gupta 等人 2022 年 3 月发布,发表于 CoRL 2022。机器人演示少,从零训练视觉编码器难学好;R3M 先在 Ego4D 人类第一人称视频上预训练图像编码器,目标组合了时间对比学习(时间上接近的帧表征更接近)、视频与语言描述对齐,以及让表征稀疏紧凑的 L1 惩罚。之后把它冻结当感知模块,下游只训练策略。在 12 个仿真操作任务上,成功率比从零训练高 20% 以上,比 CLIP、MoCo 表征高 10% 以上。它是「预训练视觉表征」路线的代表,常与 VC-1、MVP、VIP 对比。

例子在杂乱的真实公寓里,Franka 机械臂以冻结的 R3M 编码器作视觉模块,每个任务只用 20 条演示就学会了操作。

相关
预训练视觉表征、VC-1、MVP(掩码视觉预训练)、VIP(价值隐式预训练)、Ego4D 数据集、时间对比学习
来源
R3M (arXiv 2203.12601)
信息截至
2022-03

在完整名词表里查看 →