DayDreamer
DayDreamer: World Models for Physical Robot Learning进阶直接在真实机器人上用 Dreamer 世界模型学习,四足一小时从零学会走路。
伯克利 Pieter Abbeel 与 Ken Goldberg 组 2022 年 6 月提出,作者包括 Dreamer 系列作者 Danijar Hafner,发表于 CoRL 2022。真机强化学习的难点是试错太贵,所以多数工作先在仿真里训练再迁移。DayDreamer 把 Dreamer 算法直接搬到真机上:机器人一边交互,一边用收集的数据学一个世界模型(预测「做这个动作会看到什么、得多少奖励」),策略主要在世界模型的想象轨迹里学习,大幅减少真机试错。四种机器人用同一套超参数:A1 四足约 1 小时从零学会翻身、站起和行走,被推搡后约 10 分钟学会抵抗;UR5 和 xArm 机械臂从相机图像学会抓取放置;Sphero 轮式机器人学会导航到目标。它展示了世界模型强化学习在真实物理世界中的样本效率。
例子A1 四足机器人不经仿真预训练、也不需人工复位,在真实地面上学习约 1 小时,就从零学会翻身、站起和向前走。
- 也叫
- 真机 Dreamer
- 相关
- 世界模型、想象中学习、基于模型的强化学习、真机强化学习、循环状态空间模型、DreamerV3
- 来源
- DayDreamer (arXiv:2206.14176)
DayDreamer 项目主页(CoRL 2022) - 信息截至
- 2022-06