OK-Robot
OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics进阶纽约大学 2024 年的拾放系统,把现成视觉语言模型和导航、抓取模块拼起来。
OK-Robot 由纽约大学 Lerrel Pinto 团队与 Meta 合作提出(Peiqi Liu、Mahi Shafiullah 等),2024 年 1 月上 arXiv,发表于 RSS 2024。OK 指 Open Knowledge,即用互联网数据预训练好的开放知识模型。它不训练新的端到端策略,而是组合现成模块:先用带激光雷达的 iPhone(Record3D 应用)扫一遍房间,建一个带 CLIP 等语义特征的体素地图;收到「把某物放到某处」的指令后,在地图里找物体、导航过去,用 AnyGrasp 算抓取位姿,再导航到目标处放下。整套系统跑在 Hello Robot Stretch 上,换新家不用重新训练。论文重点是总结拼装时哪些细节真正影响成败,并统计了失败原因。
例子在纽约 10 个真实家庭中做了 171 次拾取-放置,整体成功率 58.5%,在较整洁的环境中为 82%;最常见的失败是语义地图找错物体(9.3%)、抓取姿态难(8.0%)和硬件问题(7.5%)。
- 相关
- 开放词汇、零样本、移动操作、AnyGrasp、Hello Robot Stretch、语义地图
- 来源
- OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics (arXiv 2401.12202)
OK-Robot 项目页
ok-robot/ok-robot GitHub 仓库 - 信息截至
- 2024-07