具身智能新手名词表English

智元 GO-1(启元大模型)

Genie Operator-1 (AgiBot GO-1)GO-1常用

智元机器人 2025 年发布的通用具身基座模型,用「潜在动作」让人类视频也能参与训练。

GO-1 是智元机器人(AgiBot)2025 年 3 月 10 日随 AgiBot World 数据集技术报告一起发布的通用操作策略,中文名启元大模型。它提出 ViLLA(视觉-语言-潜在动作)框架,分三段:潜在动作模型把相邻画面的变化压成离散的潜在动作 token,可以在 Ego4D 这类没有动作标签的人类视频上学;潜在规划器以 InternVL2.5-2B 视觉语言模型为骨干,根据图像和指令预测这些 token;动作专家再用扩散目标输出连续的高频动作。论文称在 AgiBot World(100 台机器人采集的 100 多万条轨迹)上预训练,比用 Open X-Embodiment 平均提升 30%;GO-1 在复杂真机任务上成功率超过 60%,比 RDT 高 32%。模型 2025 年 9 月开源,同时放出去掉潜在规划器的轻量版 GO-1 Air,后继是 2026 年的 GO-2。

例子开源的 GO-1 权重放在 Hugging Face 上,官方说明推理约需 7GB 显存,全参数微调(批大小 16)约需 70GB 显存。

也叫
启元大模型、Genie Operator-1、GO-1 Air
相关
ViLLA 架构、潜在动作、AgiBot World 数据集、智元 GO-2(Genie Operator-2)、动作专家、智元机器人
来源
AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems (arXiv 2503.06669)
OpenDriveLab/AgiBot-World(GitHub,含 GO-1 / GO-1 Air 开源说明)
信息截至
2025-09

在完整名词表里查看 →