具身智能新手名词表English

EnerVerse

EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation进阶

智元等提出的生成式机器人模型:先用视频扩散预测未来多视角画面,再出动作。

EnerVerse 由智元机器人与上海人工智能实验室等团队于 2025 年 1 月发布,后被 NeurIPS 2025 接收。思路是先预测未来、再决定动作:用自回归视频扩散模型根据指令逐段生成未来的「具身空间」画面,并用稀疏上下文记忆支撑长任务。为表达三维场景,作者提出 Free Anchor Views(自由锚定视角),即按任务灵活选取的多视角视频表示。EnerVerse-A 是接在生成模型后的策略头,把预测出的 4D 表示转成机器人动作;EnerVerse-D 是把生成模型与 4D 高斯泼溅结合的数据引擎,用来自动造数据、缩小仿真与真实的差距。

例子给出一条操作指令后,模型先生成几个视角下机器人完成任务的未来视频片段,策略头再据此输出动作;论文报告约 280 毫秒可输出一段 8 步动作。

也叫
EnerVerse-A、EnerVerse-D
相关
视频预测模型、世界模型、智元 Genie Envisioner 世界模型、3D高斯泼溅、多视角、视频预测策略
来源
EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation (arXiv 2501.01895)
EnerVerse 项目页
信息截至
2025-11

在完整名词表里查看 →