具身智能新手名词表English

可交互世界模型

Interactive World Model进阶

每一步接收动作输入、据此生成接下来画面的世界模型,可当神经网络模拟器用。

普通视频生成模型根据一段文字一次性生成整段视频,中途无法干预;可交互世界模型则在每一步接收动作(键盘操作、机器人控制命令或文字事件),据此生成接下来的画面,相当于用神经网络实现的模拟器。2023 年的 UniSim 融合多种数据学习对人和机器人动作的视觉响应,并在其中训练出能零样本部署到真实世界的策略;谷歌 DeepMind 2024 年的 Genie(110 亿参数)只用无动作标签的网络视频训练,靠潜在动作模型(从前后帧自动推断「做了什么动作」)实现逐帧控制;2025 年 8 月发布的 Genie 3 能以 720p、每秒 24 帧实时交互,并在几分钟内保持场景一致。对具身智能而言,它可用于评估策略、生成训练数据,或让智能体在生成的世界里学习。

例子DeepMind 把 SIMA 智能体放进 Genie 3 生成的世界:智能体发出前进、转向等导航动作,Genie 3 实时生成对应画面,智能体据此去完成给定目标。

也叫
动作条件视频模型、Action-conditioned Video Model、交互式视频生成、生成式交互环境、Generative Interactive Environment
相关
世界模型、Genie 3、UniSim、潜在动作模型、视频生成模型、世界模型评测
来源
Genie: Generative Interactive Environments (arXiv:2402.15391)
Learning Interactive Real-World Simulators (UniSim, arXiv:2310.06114)
Genie 3: A new frontier for world models(Google DeepMind 博客)
信息截至
2025-08

在完整名词表里查看 →