目标检测
Object Detection入门必知在图像里找出物体是什么、在哪里,并用方框标出来的任务。
目标检测是计算机视觉的基础任务:输入一张图,输出其中每个物体的类别、边界框(包住物体的矩形框)和置信度。早期代表是基于手工特征的 Viola-Jones 人脸检测;深度学习后出现 R-CNN 系列两阶段检测器,以及 2015 年提出的 YOLO,它把检测直接当成对边界框和类别概率的回归问题,能实时运行。评估时用交并比(IoU,两框重叠面积占合并面积的比例)判断预测框是否对上,再汇总成 mAP(各类别平均精度的均值)。传统检测器只认识训练时见过的类别,Grounding DINO 这类开放词汇检测器可以用任意文字描述去找物体。机器人里,检测常是模块化流程的第一步:先框出目标,再分割、估位姿、规划抓取。
例子用户说「把红色杯子拿给我」,系统先把「red cup」输入 Grounding DINO 得到边界框,再交给 SAM 抠出掩码,结合深度图算出杯子的三维位置,交给机械臂去抓。
- 也叫
- 物体检测、物体识别与定位
- 相关
- 检测框(边界框)、开放词汇检测、YOLO、Grounding DINO、交并比、实例分割
- 来源
- Wikipedia: Object detection
You Only Look Once: Unified, Real-Time Object Detection (arXiv 1506.02640)
Grounding DINO (arXiv 2303.05499)