具身智能新手名词表English

Gen2Act

Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation进阶

先生成一段「人怎么做」的视频,再让机器人照着视频执行的操作方法

Google DeepMind 与卡内基梅隆大学、斯坦福的研究者在 2024 年 9 月提出。它把「按语言指令操作」拆成两步:先用在网络视频上训练好的视频生成模型,不经微调、零样本地为当前场景生成一段人完成任务的视频;再由机器人策略看着这段视频执行,训练时加入点轨迹预测损失(预测画面里各点怎么移动),让策略读出视频中的运动信息。物体和动作的泛化交给见过海量网络视频的生成模型,机器人数据只需教会「把视频里的动作翻译成机器人动作」,因此能处理机器人数据里没出现过的物体类别和动作。

例子机器人数据里没有的动作类型(如画圈搅动、朝新方向拖动物体),可以靠生成的人类视频引导完成;把多段任务串起来还能做「清理桌面」「做咖啡」这类长程任务。

相关
视频生成模型、人类视频数据、任意点跟踪、行为克隆、UniPi、DreamGen(GR00T Dreams)
来源
Gen2Act (arXiv:2409.16283)
Gen2Act 项目主页
信息截至
2024-09

在完整名词表里查看 →