SayPlan
SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning进阶借助 3D 场景图,让大语言模型在多楼层大空间里做长程任务规划的方法
澳大利亚昆士兰科技大学机器人中心、阿德莱德大学和 CSIRO Data61 的研究者 2023 年 7 月发布,是 CoRL 2023 口头报告论文。用大语言模型做机器人任务规划时,如果把整栋楼的房间和物体全写进提示词,很快会超出上下文长度。SayPlan 把环境表示成分层的 3D 场景图(楼层、房间、物体及其状态),先只给模型看折叠后的高层结构,让它通过「展开」「收起」节点做语义搜索,只保留和任务相关的子图;具体怎么走交给 Dijkstra 这类经典路径规划算法,模型只管高层步骤;生成的计划先在场景图模拟器里检查,发现「往没打开的柜子里放东西」这类执行不了的步骤就反馈给模型重新修改。实验环境最大有 3 层楼、36 个房间、140 个物体,计划最后在真实移动操作机器人上执行。
例子对「我饿了,拿点吃的到我桌上」这样的指令,SayPlan 先在场景图里展开厨房找到冰箱和食物,生成「走到冰箱、打开冰箱、取出苹果、走到办公桌、放下」的计划,并在模拟器里确认每一步都能执行。
- 相关
- 3D场景图、大模型任务规划、SayCan、长程任务、重规划、移动操作
- 来源
- SayPlan (arXiv 2307.06135)
SayPlan project page - 信息截至
- 2023-09