视觉语言导航
Vision-and-Language NavigationVLN入门必知让智能体听懂自然语言路线描述,靠视觉在陌生环境里走到目的地。
视觉语言导航是 Anderson 等人在 CVPR 2018 论文中提出的具身任务:智能体收到一段类似「出门右转,经过沙发后在厨房门口停下」的指令,只靠第一人称视觉,在没去过的室内环境里一步步走到终点。配套的 Room-to-Room(R2R)数据集基于 Matterport3D 真实房屋扫描,覆盖 90 栋建筑、约 2.2 万条人工撰写的指令。它考验语言理解、视觉感知和空间记忆的配合。原版 R2R 里智能体只能在预先拍好全景图的点位之间跳转,2020 年的 VLN-CE 改成在连续三维空间里用前进、转向等底层动作移动,更接近真机;之后又出现了能在真机上运行的 NaVid、NaVILA 等模型。
例子指令「沿走廊直走,在第二扇门左转进卧室,停在床边」,机器人边看边走,最后停在床边算成功。
- 也叫
- 视觉-语言导航
- 相关
- 导航、R2R / VLN-CE 视觉语言导航基准、路径长度加权成功率、物体目标导航、NaVILA、视觉语言模型
- 来源
- Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments
Room-to-Room (R2R) 数据集主页
Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments (VLN-CE)