具身智能新手名词表English

RoboPoint

RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics进阶

根据语言指令在图上点出「放哪里、抓哪里」的视觉语言模型

RoboPoint 由华盛顿大学、英伟达、艾伦人工智能研究所等在 2024 年 6 月发布,CoRL 2024 录用。它关注空间可供性:给一张图和一句指令(如「放到盘子右边的空位」),用一组 2D 点在图上标出可行的目标位置,再借助深度图投影到 3D,交给运动规划去执行。训练数据全部由程序化生成的 3D 场景自动合成,不需要真机数据或人工演示;语言骨干是 Vicuna-13B。论文报告其空间可供性预测准确率比 GPT-4o 和视觉提示方法 PIVOT 高 21.8%,下游任务成功率高 30.5%,可用于操作、导航和 AR 辅助。这种「先输出点、再交给规划器」的做法是 VLM 与机器人之间常见的中间表示。

例子指令「把杯子放到两本书之间的空位」,RoboPoint 在图上输出一组落在空位里的点,机械臂取其中一点作为放置目标。

相关
可供性、指向(点预测)、空间推理、中间表示、合成数据、PIVOT(迭代视觉提示)
来源
arXiv 2406.10721: RoboPoint
RoboPoint 项目主页
信息截至
2024-11

在完整名词表里查看 →