Motus
Motus: A Unified Latent Action World Model进阶把理解、视频生成和动作三个专家合成一个模型的潜在动作世界模型
清华大学朱军团队联合北京大学、地平线在 2025 年 12 月发布,代码和权重以 Apache 2.0 开源。以往的方法常把理解、世界模型(预测未来画面)和控制拆成独立模型,难以共同利用大规模异构数据。Motus 用混合 Transformer(MoT)架构把理解专家、视频生成专家和动作专家连在一起,视频部分基于 Wan2.2-5B,理解部分基于 Qwen3-VL-2B,总计约 80 亿参数;再用类似 UniDiffuser 的调度,在世界模型、VLA、逆动力学模型、视频生成等模式之间切换。它用光流学出潜在动作,让没有动作标签的视频也能参与预训练,并配合三阶段训练和六层数据金字塔。在 RoboTwin 2.0 的 50 个任务上平均成功率约 87%,报告比 X-VLA 高 15%、比 π0.5 高 45%。
例子同一个 Motus 模型:给当前画面和指令,直接输出动作(VLA 模式);给画面和动作,预测接下来的视频(世界模型模式);给前后画面,反推中间做了什么动作(逆动力学模式)。
- 相关
- 世界动作模型、潜在动作、混合 Transformer 架构、逆动力学模型、数据金字塔、RoboTwin
- 来源
- Motus: A Unified Latent Action World Model (arXiv 2512.13030)
thu-ml/Motus (GitHub)
Motus project page - 信息截至
- 2025-12