3D目标检测
3D Object Detection进阶在三维空间里找出物体,给出类别和带朝向的立体框。
3D 目标检测是 2D 目标检测在三维空间的延伸:输入可以是激光雷达点云、RGB-D 图像,甚至单张彩色图,输出每个物体的类别和一个三维包围框,通常用中心坐标、长宽高和朝向角描述。2D 框只说明物体占了画面哪块像素,机器人要抓取、避障、导航,需要的是物体在真实空间里的位置、大小和朝向。自动驾驶是主要推动者,经典基准 KITTI 有 7481 张训练图及对应点云,评测车、行人、骑车人三类,车的 3D 框交并比(IoU)要达到 0.7 才算检对。面向室内和通用场景的有 Omni3D 基准(23.4 万张图、98 类)及配套的 Cube R-CNN 模型。它常和 6D 位姿估计对照:后者更精细,要给出物体完整的三维旋转。
例子仓储机器人用激光雷达点云做 3D 检测,得到每个货箱的中心位置、尺寸和朝向,据此规划叉取或抓取的位置。
- 也叫
- 三维目标检测、3D 包围框检测、3D Detection
- 相关
- 目标检测、点云、激光雷达、鸟瞰图、交并比、6D位姿估计
- 来源
- KITTI 3D Object Detection Evaluation 2017
Omni3D: A Large Benchmark and Model for 3D Object Detection in the Wild (arXiv 2207.10660)