具身智能新手名词表English

VIMA

VIMA: General Robot Manipulation with Multimodal Prompts进阶

用图文混排的「多模态提示」统一描述各种操作任务的 Transformer 机器人智能体

斯坦福、英伟达、加州理工等机构的 Yunfan Jiang、Linxi Fan、Yuke Zhu、李飞飞等人 2022 年 10 月发布,发表于 ICML 2023。机器人任务的下达方式五花八门:给一段演示让它照做、用语言描述、给一张目标图。VIMA 把它们统一成「文字和图片穿插」的多模态提示,比如「把 [某物体的图] 放进 [某容器的图]」,由一个 Transformer 读入提示并自回归地输出动作。作者还做了仿真基准 VIMA-Bench:17 类任务模板、可程序化生成成千上万个桌面任务、60 多万条专家轨迹,以及四级逐步变难的泛化评测。论文称在最难的零样本设定下成功率比其他设计最高高 2.9 倍。

例子给 VIMA 的提示是一句话里夹着两张小图:「把 [红色积木图] 放到 [绿色盘子图] 上」,它就在仿真桌面上找到对应物体完成抓放;换成先给一段演示图再说「照这样做」也用同一个模型。

相关
VIMA-Bench、语言条件策略、组合泛化、桌面操作、模仿学习、Transformer
来源
VIMA (arXiv 2210.03094)
VIMA project page
信息截至
2023-05

在完整名词表里查看 →