RoboPoint
RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics进阶根据语言指令在图上点出「放哪里、抓哪里」的视觉语言模型
RoboPoint 由华盛顿大学、英伟达、艾伦人工智能研究所等在 2024 年 6 月发布,CoRL 2024 录用。它关注空间可供性:给一张图和一句指令(如「放到盘子右边的空位」),用一组 2D 点在图上标出可行的目标位置,再借助深度图投影到 3D,交给运动规划去执行。训练数据全部由程序化生成的 3D 场景自动合成,不需要真机数据或人工演示;语言骨干是 Vicuna-13B。论文报告其空间可供性预测准确率比 GPT-4o 和视觉提示方法 PIVOT 高 21.8%,下游任务成功率高 30.5%,可用于操作、导航和 AR 辅助。这种「先输出点、再交给规划器」的做法是 VLM 与机器人之间常见的中间表示。
例子指令「把杯子放到两本书之间的空位」,RoboPoint 在图上输出一组落在空位里的点,机械臂取其中一点作为放置目标。
- 相关
- 可供性、指向(点预测)、空间推理、中间表示、合成数据、PIVOT(迭代视觉提示)
- 来源
- arXiv 2406.10721: RoboPoint
RoboPoint 项目主页 - 信息截至
- 2024-11