具身智能新手名词表English

OWL-ViT / OWLv2

OWL-ViT / OWLv2 (Open-World Localization Vision Transformer)进阶

谷歌提出的开放词汇目标检测模型,可用文字或示例图查找物体。

OWL-ViT 由 Google 的 Matthias Minderer 等人提出,发表于 ECCV 2022。做法是先用 CLIP 式图文对比学习预训练视觉 Transformer,再端到端微调成检测器:图像每个小块输出一个框和一个特征,与文字特征比相似度,就能检测没见过的类别;也支持给一张示例图做单样本检测。2023 年的 OWLv2 用自训练扩数据:拿现有检测器给网上图文对自动生成伪框标注,规模超过 10 亿例,LVIS 稀有类 AP 从 31.2% 升到 44.6%。两者已进入 Hugging Face Transformers,常被机器人系统用来按语言指令定位物体。

例子输入一张桌面图像和文字「a red mug」,OWLv2 返回杯子的检测框和置信度,机器人再用框内的深度估计抓取位置。

也叫
OWL-ViT、OWLv2、OWL-ST
相关
开放词汇检测、CLIP、Grounding DINO、YOLO-World、视觉 Transformer、OK-Robot
来源
Simple Open-Vocabulary Object Detection with Vision Transformers (arXiv 2205.06230)
Scaling Open-Vocabulary Object Detection (arXiv 2306.09683)
Hugging Face Transformers: OWLv2

在完整名词表里查看 →