3D视觉定位
3D Visual Grounding进阶根据一句话的描述,在三维场景里找到它指的那个物体。
3D 视觉定位把 2D 视觉定位(用文字在图片里框出目标)搬到三维场景:输入场景的点云或多视角图像,加一句描述,如「靠窗那把椅子旁边的垃圾桶」,输出目标物体的三维包围框。中文「视觉定位」也常指估计相机自身位置,这里指的是 grounding。难点是场景里常有多个同类物体,必须理解「左边」「最大的」「挨着门」这类空间关系才能区分。ScanRefer 和 ReferIt3D(均发表于 ECCV 2020)在 ScanNet 室内扫描上建立了基准,前者含约 5.2 万条描述、1.1 万个物体,后者含 Nr3D 自然描述和 Sr3D 空间关系描述两套数据。对机器人来说,它是把语言指令落到具体物体上的关键一步。
例子用户说「把书桌上最右边那个蓝色杯子给我」,机器人先在重建好的房间点云里做 3D 视觉定位,得到那只杯子的三维框,再规划抓取。
- 也叫
- 3D Grounding、3D 视觉接地、3D 指代定位、3D Referring Expression Grounding
- 相关
- 视觉定位(Grounding)、ScanNet 数据集、3D目标检测、3D场景图、开放词汇检测、语言接地
- 来源
- ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language (ECCV 2020)
ReferIt3D: Neural Listeners for Fine-Grained 3D Object Identification in Real-World Scenes (ECCV 2020)