具身智能新手名词表English

LM-Nav

LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action进阶

把 GPT-3、CLIP 和视觉导航模型拼起来,让机器人按自然语言指令导航。

LM-Nav 是 Dhruv Shah、Brian Ichter、Sergey Levine 等人 2022 年 7 月发布的工作,发表于 CoRL 2022。用语言指挥机器人导航,通常需要大量带文字说明的轨迹数据,标注很贵。LM-Nav 不做任何微调、不用语言标注的机器人数据,而是组合三个现成的预训练模型:大语言模型 GPT-3 把指令拆成一串地标;图文模型 CLIP 判断机器人拍到的画面对应哪个地标;视觉导航模型 ViNG 用过去采集的图像建立环境拓扑图并执行到点策略。系统再搜索出按顺序经过这些地标的最短路线。它在真实户外环境完成了长距离导航,是用基础模型拼装机器人系统这一思路的早期代表。

例子例如用户说「经过停车标志后去白色大楼」,GPT-3 提取出「停车标志」「白色大楼」两个地标,CLIP 在拓扑图里找到对应位置,ViNG 依次开过去。

相关
视觉语言导航、CLIP、拓扑地图、大模型任务规划、GNM(通用导航模型)、ViNT
来源
arXiv 2207.04429: LM-Nav
LM-Nav 项目主页
信息截至
2022-07

在完整名词表里查看 →