BFM-Zero
BFM-Zero: A Promptable Behavioral Foundation Model for Humanoid Control Using Unsupervised RL进阶不用任务奖励训练、靠「提示」切换任务的人形全身控制基础模型。
BFM-Zero 是卡内基梅隆大学石冠亚组与 Meta 等机构 2025 年 11 月发布的人形机器人行为基础模型。它用无监督强化学习训练:训练时不给具体任务奖励,而是借助前向-后向表示(Forward-Backward,把状态和任务映射进同一个隐空间的方法)学出共享隐空间,参考动作、目标姿态和奖励函数都能编码成这个空间里的向量。部署时给出对应向量(即「提示」),同一个策略就能零样本完成动作跟踪、到达目标姿态、按奖励优化等任务,也支持少样本适配。团队在宇树 G1 真机上演示了抗推扰和摔倒后恢复,称其为首个可在真实人形上用提示切换任务的行为基础模型。
例子同一个部署在宇树 G1 上的 BFM-Zero 策略:输入一段参考动作就做动作跟踪,输入一个目标姿态就去摆出它,输入一个奖励函数就按奖励行动,中间不重新训练。
- 也叫
- BFM Zero
- 相关
- 行为基础模型、无监督技能发现、运动跟踪、宇树 G1、Meta Motivo(人形行为基础模型)、学习型全身控制
- 来源
- BFM-Zero (arXiv 2511.04131)
BFM-Zero 项目主页 - 信息截至
- 2025-11