PIVOT(迭代视觉提示)
PIVOT: Iterative Visual Prompting Elicits Actionable Knowledge for VLMs进阶在图上画候选动作让 VLM 反复挑选、逐轮收窄,零样本控制机器人
Google DeepMind 主导(Soroush Nasiriany、Fei Xia 等 23 位作者)的工作,2024 年 2 月发布,ICML 2024 论文。VLM 只会输出文字,而机器人需要连续的坐标和动作。PIVOT 把问题改成迭代的视觉问答:先采样一批候选(落点、移动方向或轨迹),在图像上画成带编号的箭头或点;让 VLM 选出最好的几个;再根据选中的候选拟合分布、重新采样,范围越缩越小,几轮后得到最终动作。整个过程不需要任何机器人训练数据,就能做真机导航、桌面操作、仿真指令跟随和图像定位,但作者也承认成功率离实用还远。它是视觉提示路线的代表,思路与 MOKA、Set-of-Mark 相近。
例子让移动机器人去桌边拿可乐:第一轮在画面上画出若干编号箭头表示可走方向,VLM 选中 3 号和 5 号;下一轮只在这两个方向附近重新画箭头再选,直到方向足够精确。
- 也叫
- PIVOT、迭代视觉提示
- 相关
- 视觉提示(Set-of-Mark 标记提示)、MOKA(标记式视觉提示操作)、视觉语言模型、零样本、交叉熵方法、RoboPoint
- 来源
- arXiv 2402.07872: PIVOT
ICML 2024 论文页(PMLR v235)
PIVOT 项目主页 - 信息截至
- 2024-07