DETR
DEtection TRansformer进阶用 Transformer 把目标检测直接当作「集合预测」来做的端到端检测器。
DETR 是 Facebook AI(现 Meta)的 Nicolas Carion 等人提出的目标检测模型,发表于 ECCV 2020。此前的检测器如 Faster R-CNN 要先铺大量锚框(预设的候选框),最后用非极大值抑制删掉重复框。DETR 先用 CNN 提取图像特征,送进 Transformer 编码器-解码器,解码器用固定数量的可学习「物体查询」各自输出一个框和类别;训练时用二分图匹配把预测与真值一对一配对,因此不再需要锚框和 NMS。它在 COCO 上精度与调优过的 Faster R-CNN 相当,但训练收敛慢。后来的 Deformable DETR、Grounding DINO、DINO-X 都沿这条路线发展;具身领域的 ACT 用可学习查询解码动作,代码也改自 DETR。
例子官方 DETR(ResNet-50 骨干)在 COCO 2017 验证集上训练 500 轮达到 42.0 AP,与同骨干的 Faster R-CNN 相当,计算量约为其一半。
- 也叫
- End-to-End Object Detection with Transformers
- 相关
- 目标检测、Transformer、检测框(边界框)、非极大值抑制、Grounding DINO、可学习查询
- 来源
- arXiv 2005.12872: End-to-End Object Detection with Transformers
ECCV 2020 paper page: End-to-End Object Detection with Transformers
facebookresearch/detr (GitHub)