具身智能新手名词表English

DreamZero

DreamZero (World Action Models are Zero-shot Policies)进阶

英伟达 2026 年的世界动作模型,基于 14B 视频扩散模型同时预测画面和动作。

DreamZero 是英伟达研究团队(Jim Fan、Yuke Zhu 等参与)于 2026 年 2 月发布的世界动作模型(WAM,同时预测未来画面和动作的模型),论文题为 World Action Models are Zero-shot Policies。主流 VLA 以视觉语言模型为底座,擅长理解语义,但对物理动态了解有限。DreamZero 改用预训练视频扩散模型做底座(通义万相 Wan2.1 图生视频 14B),自回归地联合生成未来视频和机器人动作,把视频当作「世界如何变化」的稠密监督,因此能从多样、不重复的异构机器人数据里学习。论文称它对新任务、新环境的泛化比当时最好的 VLA 高出一倍以上;经模型和系统优化,在 GB200 上单次推理约 150 毫秒,实现 7Hz 闭环控制。团队表示开源模型权重和推理代码。

例子主要用智元 G1 约 500 小时遥操作数据训练,已见任务平均任务进度 62.2%(最佳 VLA 基线 27.4%);只加 10–20 分钟其他机器人或人类的视频,未见任务表现相对提升 42% 以上;用 30 分钟玩耍数据即可适配新的 YAM 机器人。

也叫
World Action Models are Zero-shot Policies
相关
世界动作模型、视频生成模型、通义万相、零样本、跨本体、Fast-WAM
来源
World Action Models are Zero-shot Policies (arXiv 2602.15922)
DreamZero 项目主页
信息截至
2026-02

在完整名词表里查看 →