VoxPoser
VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models常用让大模型写代码生成 3D 价值地图,再交给规划器算出机械臂轨迹的零样本方法。
VoxPoser 由斯坦福大学李飞飞、吴佳俊团队与 UIUC 李云竺合作,2023 年 7 月发布,获 CoRL 2023 口头报告,一作黄文龙。大语言模型懂常识,但不知道动作该落在三维空间的哪里。VoxPoser 让大语言模型根据指令写代码,代码调用视觉语言模型找到相关物体,在体素网格(把空间切成小立方体)上拼出「可供性地图」(该去哪里)和「约束地图」(该避开哪里),再把它们作为代价函数交给运动规划器,算出末端执行器轨迹。整个过程不需要为任务训练策略,属于零样本;执行时闭环重规划,物体被挪动也能应对。它是「大模型+中间表示+传统规划」路线的代表作,后续的 ReKep 等沿着这个方向继续做。
例子指令「打开最上面的抽屉,小心旁边的花瓶」:大模型写的代码先定位顶层抽屉把手,在周围标高价值;再定位花瓶,把附近区域标成高代价;规划器据此算出一条绕开花瓶去拉把手的轨迹。
- 相关
- 大模型任务规划、代码即策略、可供性、中间表示、ReKep、运动规划
- 来源
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models (arXiv 2307.05973)
VoxPoser 项目页 - 信息截至
- 2023-11