视觉提示
Visual Prompting (e.g. Set-of-Mark)进阶在图上画框、标编号,让多模态大模型按标记回答
视觉提示指不改模型权重,直接在输入图像上叠加框、点、箭头、编号等标记,引导多模态大模型关注并指代特定区域。代表方法是微软团队 2023 年提出的 Set-of-Mark(SoM):先用 SAM、SEEM 等分割模型把图切成若干区域,在每块上标数字、掩码或框,再让 GPT-4V 用编号作答;论文报告零样本下在 RefCOCOg 指代任务上超过全量微调的专用模型。它解决的是大模型能描述画面、却难以用文字精确说出像素位置的问题。机器人方向的 MOKA、PIVOT 等工作用这类标记让视觉语言模型挑出抓取点或移动方向,再交给底层控制执行。
例子桌面照片上给每个物体标 1 到 8 号,问模型「哪个物体能用来舀汤」,模型回答「5 号」,程序再把 5 号区域换算成三维坐标交给机械臂。
- 也叫
- Set-of-Mark、SoM、标记式视觉提示
- 相关
- 视觉提示(Set-of-Mark 标记提示)、MOKA(标记式视觉提示操作)、PIVOT(迭代视觉提示)、视觉定位(Grounding)、分割一切模型、视觉语言模型
- 来源
- Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V (arXiv)
MOKA: Open-World Robotic Manipulation through Mark-Based Visual Prompting (arXiv)