Grounded-SAM
Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks进阶用一句文字就能把图里对应物体框出来并精细分割的开源流水线
IDEA 研究院开源的开放世界视觉流水线,2024 年 1 月发布技术报告。核心是把两个模型串起来:Grounding DINO 按文字描述找物体、输出检测框,SAM(分割一切模型)拿到框后输出像素级掩码。这样输入任意文字,比如「红色杯子」,就能得到对应物体的掩码,不用为新类别重新训练;它还能接 RAM、BLIP 自动打标签,接 Stable Diffusion 做图像编辑。报告称其在 SegInW 零样本分割基准上达到 48.7 mAP。机器人里常用它按语言指定目标、抠出物体点云再做抓取或位姿估计,也用来自动标注数据;后续的 Grounded SAM 2 接入 SAM 2,能在视频里跟踪物体。
例子机器人收到「把香蕉放进碗里」,先用 Grounded-SAM 分别分割出 banana 和 bowl 的掩码,再结合深度图算出两者的三维位置,交给抓取和运动规划模块。
- 也叫
- Grounded SAM、Grounded-Segment-Anything
- 相关
- Grounding DINO、分割一切模型、开放词汇分割、开放词汇检测、SAM 2(视频分割一切)、自动标注
- 来源
- Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks (arXiv 2401.14159)
IDEA-Research/Grounded-Segment-Anything GitHub - 信息截至
- 2024-01