VideoMimic
VideoMimic (Visual Imitation Enables Contextual Humanoid Control)进阶从手机拍的普通人类视频里学会爬楼梯、坐椅子等技能的人形机器人方法
UC Berkeley 的 Angjoo Kanazawa、Jitendra Malik、Pieter Abbeel 等人 2025 年 5 月发布,获 CoRL 2025 最佳学生论文奖。要让人形机器人学会「借助环境」的动作,如上下楼梯、坐到椅子上,需要同时知道人怎么动和周围地形长什么样。VideoMimic 是一条真-仿-真流水线:从单目视频里同时重建出有真实尺度的人体 4D 轨迹和场景几何;把人体动作重定向到机器人身上,把场景转成仿真器里的网格;在仿真中用强化学习训练跟踪这些动作的策略,再蒸馏成一个只看本体感知、身体周围高度图和目标方向的单一策略。最终部署在 23 自由度的宇树 G1 上。
例子用手机拍一段人走上台阶、再坐到长椅上的视频,经 VideoMimic 处理后,宇树 G1 能在真实环境里自主完成上楼梯和坐下起身,且同一个策略适用于不同的楼梯和椅子。
- 也叫
- Visual Imitation Enables Contextual Humanoid Control
- 相关
- 真-仿-真闭环、4D重建、动作重定向、运动跟踪、人类视频数据、宇树 G1
- 来源
- Visual Imitation Enables Contextual Humanoid Control (arXiv 2505.03729)
VideoMimic project page - 信息截至
- 2025-09