开放词汇分割
Open-Vocabulary Segmentation进阶用任意文字描述类别,模型就能把对应的像素分割出来。
传统分割模型只能分出训练时定好的那几十上百个类别;开放词汇分割允许测试时用任意文字指定类别,比如「蓝色的洗碗海绵」,模型输出对应的像素掩码。它的底子是 CLIP 这类图文对比预训练模型:把图像每个像素或区域的特征和文字特征放进同一个空间,按相似度决定归属。代表工作有 ICLR 2022 的 LSeg,后来有把开放词汇检测器和 SAM 拼起来的 Grounded-SAM,以及直接接受名词短语提示的 SAM 3。对机器人来说,它让「把桌上某样东西找出来」不必为每个新物体重新标数据、重新训练。
例子用户说「把充电线收起来」,机器人把「充电线」作为文本输入分割模型,拿到线的像素掩码,再结合深度图算抓取点。
- 也叫
- 开集分割、开放词汇语义分割
- 相关
- 开放词汇检测、语义分割、CLIP、Grounded-SAM、SAM 3(可提示概念分割)、开放词汇
- 来源
- Language-driven Semantic Segmentation (LSeg, arXiv 2201.03546)
Towards Open Vocabulary Learning: A Survey (arXiv 2306.15880)