UH-1 / Humanoid-X
UH-1: Learning from Massive Human Videos for Universal Humanoid Pose Control (Humanoid-X dataset)UH-1进阶从海量互联网人类视频学习、按文字指令生成人形机器人动作的大模型
南加州大学(王越团队)、UC Berkeley 与丰田研究院 2024 年 12 月发布,后在 Humanoids 2025 会议做口头报告。人形机器人数据主要靠强化学习和遥操作获得,难以扩大规模;这项工作改从互联网人类视频里学。团队先建 Humanoid-X 数据集:从视频中提取 3D 人体姿态并自动生成文字描述,再重定向成人形机器人的关键点和动作,共约 16.4 万段动作、2000 多万个机器人姿态。在此基础上训练 UH-1:先把人形动作离散成 token,再用 Transformer 根据文字指令自回归生成动作 token。输出既可以是关键点,交给目标条件策略去跟踪;也可以直接是机器人动作,开环执行。它展示了「人类视频加文本,转成人形动作」这条扩大数据规模的路线。
例子输入文字「挥手打招呼」,UH-1 生成对应的人形动作序列,交给底层控制器驱动人形机器人做出挥手动作。
- 也叫
- Humanoid-X、Universal Humanoid Pose Control
- 相关
- Humanoid-X 数据集、人类视频数据、动作重定向、文本驱动动作生成、动作分词器、人形机器人
- 来源
- Learning from Massive Human Videos for Universal Humanoid Pose Control (arXiv 2412.14172)
UH-1 project page (PSI Lab) - 信息截至
- 2024-12