具身智能新手名词表English

3D目标检测

3D Object Detection进阶

在三维空间里找出物体,给出类别和带朝向的立体框。

3D 目标检测是 2D 目标检测在三维空间的延伸:输入可以是激光雷达点云、RGB-D 图像,甚至单张彩色图,输出每个物体的类别和一个三维包围框,通常用中心坐标、长宽高和朝向角描述。2D 框只说明物体占了画面哪块像素,机器人要抓取、避障、导航,需要的是物体在真实空间里的位置、大小和朝向。自动驾驶是主要推动者,经典基准 KITTI 有 7481 张训练图及对应点云,评测车、行人、骑车人三类,车的 3D 框交并比(IoU)要达到 0.7 才算检对。面向室内和通用场景的有 Omni3D 基准(23.4 万张图、98 类)及配套的 Cube R-CNN 模型。它常和 6D 位姿估计对照:后者更精细,要给出物体完整的三维旋转。

例子仓储机器人用激光雷达点云做 3D 检测,得到每个货箱的中心位置、尺寸和朝向,据此规划叉取或抓取的位置。

也叫
三维目标检测、3D 包围框检测、3D Detection
相关
目标检测、点云、激光雷达、鸟瞰图、交并比、6D位姿估计
来源
KITTI 3D Object Detection Evaluation 2017
Omni3D: A Large Benchmark and Model for 3D Object Detection in the Wild (arXiv 2207.10660)

在完整名词表里查看 →