Gen2Act
Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation进阶先生成一段「人怎么做」的视频,再让机器人照着视频执行的操作方法
Google DeepMind 与卡内基梅隆大学、斯坦福的研究者在 2024 年 9 月提出。它把「按语言指令操作」拆成两步:先用在网络视频上训练好的视频生成模型,不经微调、零样本地为当前场景生成一段人完成任务的视频;再由机器人策略看着这段视频执行,训练时加入点轨迹预测损失(预测画面里各点怎么移动),让策略读出视频中的运动信息。物体和动作的泛化交给见过海量网络视频的生成模型,机器人数据只需教会「把视频里的动作翻译成机器人动作」,因此能处理机器人数据里没出现过的物体类别和动作。
例子机器人数据里没有的动作类型(如画圈搅动、朝新方向拖动物体),可以靠生成的人类视频引导完成;把多段任务串起来还能做「清理桌面」「做咖啡」这类长程任务。
- 相关
- 视频生成模型、人类视频数据、任意点跟踪、行为克隆、UniPi、DreamGen(GR00T Dreams)
- 来源
- Gen2Act (arXiv:2409.16283)
Gen2Act 项目主页 - 信息截至
- 2024-09