具身智能新手名词表English

视觉位置识别

Visual Place RecognitionVPR进阶

看一张图,判断这是哪个地方、之前是否来过

视觉位置识别(VPR)指给定一张当前拍到的图像,从事先存好的、带位置信息的图像库里找出它拍的是哪个地方,本质上是一个图像检索问题。难点在于同一地点会因光照、季节、昼夜和拍摄视角不同而看起来差别很大。常见做法是把图像的局部特征聚合成一个全局描述向量再比对相似度,CVPR 2016 的 NetVLAD 用可训练的聚合层和谷歌街景不同年份的图像做弱监督训练,是常用基线。在机器人里,VPR 主要服务于 SLAM 的回环检测和跟丢后的重定位(重新确定自己在地图里的位置),也用于基于拓扑地图的导航。

例子扫地机器人被人抱到另一个房间放下后,拿当前画面和建图时存下的关键帧逐一比对,找到最像的那一帧,从而知道自己在哪个房间。

也叫
视觉地点识别、地点识别
相关
回环检测、重定位、视觉SLAM、拓扑地图、特征匹配、导航
来源
Where is your place, Visual Place Recognition? (Garg et al., IJCAI 2021)
NetVLAD: CNN architecture for weakly supervised place recognition (CVPR 2016)

在完整名词表里查看 →