具身智能新手名词表English

MT-Opt

MT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale进阶

谷歌用 7 台真机采 9600 小时数据、同时学 12 个任务的多任务强化学习系统

Robotics at Google 的 Dmitry Kalashnikov、Chelsea Finn、Sergey Levine、Karol Hausman 等人 2021 年 4 月发布,是 QT-Opt(谷歌基于 Q 学习的大规模抓取强化学习)的多任务扩展。团队用 7 台机器人在 57 天里连续采集约 9600 机器人小时、80 多万个回合的数据,同时学习挑拣特定物体、放入容器、摆齐、覆盖等 12 个真实任务。关键设计有两个:用多任务成功检测器自动判断任务是否完成并给奖励;把一个任务的回合共享给其他任务并重新平衡数据量,让数据少的任务借到常见任务的经验。稀有任务的平均成功率从单任务 QT-Opt 的 1% 提升到 50%,新任务在约一天内就能微调学会。它是谷歌在 RT-1 之前探索真机规模化学习的重要工作。

例子要教机器人一个新任务「用毛巾盖住物体」,不用从头训练,在已学到的抓取等技能基础上补采约一天数据微调即可。

相关
QT-Opt、强化学习、多任务学习、成功检测器、真机强化学习、离线强化学习
来源
MT-Opt (arXiv 2104.08212)
Multi-Task Robotic Reinforcement Learning at Scale (Google Research blog, 2021-04-19)
MT-Opt project page
信息截至
2021-04

在完整名词表里查看 →