具身智能新手名词表English

UniPi

UniPi: Learning Universal Policies via Text-Guided Video Generation进阶

先按文字生成一段完成任务的视频,再从视频里反推出机器人动作的方法

MIT、Google Brain、UC Berkeley 与阿尔伯塔大学(Yilun Du、Pieter Abbeel 等)2023 年 1 月发布,发表于 NeurIPS 2023。它把决策问题改写成「文本条件视频生成」:给定文字目标和当前画面,用视频扩散模型生成一段完成任务的未来视频当作计划,再用逆动力学模型(根据前后两帧推算中间动作的模型)从相邻帧算出机器人该执行的动作。因为不同机器人、不同环境都统一成了图像,模型能跨任务共享知识;文字目标可以自由组合,带来组合泛化;在互联网图文视频上预训练,也能提升对新指令的泛化。它是「视频生成模型当策略」路线的早期代表,UniSim、视频预测策略等后续工作沿用了相近思路。

例子输入「把红色积木放进蓝色碗里」,UniPi 先生成一段机器人完成这件事的短视频,再由逆动力学模型逐帧反推出动作去执行。

也叫
Universal Policies via Text-Guided Video Generation
相关
UniSim、视频生成模型、逆动力学模型、视频预测策略、SuSIE、世界模型
来源
Learning Universal Policies via Text-Guided Video Generation (arXiv 2302.00111)
UniPi project page
信息截至
2023-11

在完整名词表里查看 →