具身智能新手名词表English

UWM(统一世界模型)

Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic DatasetsUWM进阶

把动作扩散和视频扩散合进一个模型、能用无动作视频预训练的机器人框架

华盛顿大学(Abhishek Gupta 团队)与丰田研究院 2025 年 4 月发布,发表于 RSS 2025。模仿学习需要带动作标签的机器人数据,大量没有动作标签的视频很难直接用上。UWM 在一个 Transformer 里同时跑动作扩散和视频扩散,并给两种模态各自独立的去噪时间步:把某个模态设成纯噪声,就相当于不看它。于是同一个模型通过不同时间步组合,可以当策略、正向动力学模型、逆动力学模型或视频预测器用;遇到无动作视频,就把缺失的动作当成完全加噪来训练。在 DROID 大规模数据上预训练再微调,比单纯行为克隆预训练泛化更好,加入无动作视频还能进一步提升效果。

例子把 DROID 里的机器人轨迹和一批没有动作标签的操作视频一起拿来预训练 UWM,再用少量示教把它微调成某个具体任务的策略。

也叫
Unified World Models
相关
世界模型、扩散模型、无动作标签视频、逆动力学模型、DROID 数据集、UVA
来源
Unified World Models (arXiv 2504.02792)
UWM project page
信息截至
2025-05

在完整名词表里查看 →