具身智能新手名词表English

WoW 具身世界模型

WoW: Towards a World omniscient World model Through Embodied InteractionWoW进阶

用 200 万条真机交互轨迹训练的 140 亿参数具身视频世界模型

北京人形机器人创新中心联合北京大学、香港科技大学 2025 年 9 月发布。作者认为只看被动视频学不到真正的物理直觉,必须从大量带因果关系的交互中学,于是用 200 万条真实机器人轨迹(覆盖 12 种机器人平台)训练了一个 140 亿参数的扩散 Transformer 视频生成模型。生成视频常有物理错误,作者用 SOPHIA 框架让视觉语言模型当评审,反复检查结果并改写提示词,把生成往合理方向纠正;再用逆动力学模型(从前后帧反推动作)把预测视频翻译成机械臂动作。团队还发布了评测物理一致性和因果推理的 WoWBench。

例子例如给定桌面画面和一句操作指令,WoW 先生成完成该操作的视频,再由逆动力学模块把视频转成末端执行器的 7 自由度动作去执行。

也叫
WoW-DiT
相关
世界模型、视频生成模型、逆动力学模型、扩散 Transformer、北京人形机器人创新中心、北京人形 XR-1
来源
WoW (arXiv:2509.22642)
WoW 项目主页
信息截至
2025-10

在完整名词表里查看 →