具身智能新手名词表English

VLFM(视觉语言前沿地图)

VLFM: Vision-Language Frontier Maps for Zero-Shot Semantic NavigationVLFM进阶

用视觉语言模型给探索边界打分,零样本在陌生环境里找指定物体。

VLFM 由佐治亚理工学院和波士顿动力 AI 研究所的 Naoki Yokoyama、Dhruv Batra、Bernadette Bucher 等人提出,2023 年 12 月上线 arXiv,发表于 ICRA 2024 并获该会认知机器人方向最佳论文。任务是物体目标导航:在没去过的环境里找到某类物体。它用深度图建占据地图,找出已知与未知区域的交界(前沿);同时用 BLIP-2 计算当前画面与「附近可能有目标」这类文字提示的相似度,写进一张语言价值地图,然后选价值最高的前沿去探索。看到目标后用 YOLOv7、Grounding DINO 检测,Mobile-SAM 抠出轮廓再走过去。整个流程无需针对导航训练,在 Gibson、HM3D、MP3D 上按 SPL(路径长度加权成功率)取得当时最佳,并直接部署到波士顿动力 Spot 上。

例子在一栋没有预先建图的办公楼里,Spot 收到要找的物体类别后,优先走向视觉语言模型认为更可能出现该物体的方向,找到后停在旁边。

也叫
Vision-Language Frontier Maps、视觉语言前沿地图
相关
物体目标导航、前沿探索、零样本、路径长度加权成功率、占据栅格地图、VLMaps
来源
VLFM: Vision-Language Frontier Maps for Zero-Shot Semantic Navigation (arXiv 2312.03275)
VLFM 项目页
信息截至
2024-05

在完整名词表里查看 →