具身智能新手名词表English

CoPa

CoPa: General Robotic Manipulation through Spatial Constraints of Parts with Foundation Models进阶

让 GPT-4V 找出物体部件并写出空间约束,免训练完成开放指令操作的框架。

清华大学、上海期智研究院、上海交大和上海人工智能实验室的高阳团队 2024 年 3 月提出。它不训练机器人策略,而是让基础模型(在海量数据上预训练的通用大模型)直接给出操作需要的几何信息。一次操作拆成两步:先是「面向任务的抓取」,用 GPT-4V 配合 Set-of-Mark 视觉标记提示,从整个物体到具体部件由粗到细选出该抓哪里,再由 GraspNet 生成抓取位姿;然后是「面向任务的运动规划」,让视觉语言模型找出与任务相关的部件(如锤头、钉子),写出它们之间应满足的空间约束,求解得到抓取后的目标位姿,交给运动规划器执行。它和 VoxPoser、ReKep 同属「大模型出约束、传统规划执行」路线,能处理开放指令和没见过的物体。

例子指令「用锤子敲钉子」:CoPa 先让 GPT-4V 在锤子上选中锤柄作为抓取部位,再找出锤头敲击面和钉子,约束锤头对准钉子、敲击方向与钉子轴线一致,求出敲击前锤子的位姿后执行。

也叫
部件空间约束操作、Spatial Constraints of Parts
相关
ReKep、VoxPoser、OmniManip、视觉提示(Set-of-Mark 标记提示)、任务导向抓取(功能性抓取)、可供性
来源
CoPa (arXiv:2403.08248)
CoPa 项目主页
信息截至
2024-03

在完整名词表里查看 →