Genie 2
Genie 2 (Google DeepMind)进阶谷歌 DeepMind 的大规模世界模型,从一张图生成可操控的 3D 世界
Google DeepMind 于 2024 年 12 月 4 日发布的基础世界模型,是 Genie(初代)的后继。输入一张图片(可以是 Imagen 3 文生图的结果,也可以是真实照片),就能生成可用键盘鼠标操控的 3D 环境,画面一致性最长可保持约一分钟,多数示例在 10–20 秒。架构是在大规模视频数据上训练的自回归潜在扩散模型,即在压缩后的隐空间里一帧接一帧地去噪生成。它能模拟重力、水、烟等效果和物体交互,并记住移出视野的内容。主要用途是给 SIMA 等智能体提供多样的训练和评测环境,后续版本是 Genie 3。
例子输入一张真实世界的照片,Genie 2 可以把它变成一个能用键盘操控、以第一人称视角走动的交互式 3D 场景。
- 相关
- Genie(初代)、Genie 3、世界模型、可交互世界模型、潜在扩散模型、SIMA 2
- 来源
- Genie 2: A large-scale foundation world model (Google DeepMind Blog)
- 信息截至
- 2024-12