OKAMI
OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation进阶德州大学与英伟达 2024 年的方法,让人形机器人看一段人类视频学会操作。
OKAMI 由德州大学奥斯汀分校朱玉可团队与英伟达研究院提出,2024 年 10 月上 arXiv,是 CoRL 2024 口头报告论文。目标是让人形机器人只看一段人类示范的 RGB-D 视频就学会一个操作任务,不用遥操作采数据。第一步分析视频:用 GPT-4V 找出任务相关物体,用 Grounded-SAM 分割、Cutie 跟踪物体,再重建人的身体和手部动作(SMPL-H 模型),得到参考计划。第二步做物体感知的动作重定向:先定位当前场景里物体在哪,再把人的手臂轨迹按物体位置调整后映射到机器人身上,手指动作也一并迁移。实验平台是傅利叶 GR1 人形,配两只 6 自由度因时灵巧手。执行成功的轨迹还能当数据训练闭环视觉运动策略。
例子在装袋、撒盐、把零食放到盘子上、合上笔记本电脑等 6 个任务上,OKAMI 平均成功率 71.7%,比基线 ORION 高 58.3 个百分点;用它产生的轨迹训练的视觉运动策略平均成功率 79.2%。
- 相关
- 从观测中模仿学习、动作重定向、人类视频数据、单样本模仿学习、人形机器人、傅利叶 GR-1
- 来源
- OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation (arXiv 2410.11792)
OKAMI 项目页 - 信息截至
- 2024-11