智元 GO-1(启元大模型)
Genie Operator-1 (AgiBot GO-1)GO-1常用智元机器人 2025 年发布的通用具身基座模型,用「潜在动作」让人类视频也能参与训练。
GO-1 是智元机器人(AgiBot)2025 年 3 月 10 日随 AgiBot World 数据集技术报告一起发布的通用操作策略,中文名启元大模型。它提出 ViLLA(视觉-语言-潜在动作)框架,分三段:潜在动作模型把相邻画面的变化压成离散的潜在动作 token,可以在 Ego4D 这类没有动作标签的人类视频上学;潜在规划器以 InternVL2.5-2B 视觉语言模型为骨干,根据图像和指令预测这些 token;动作专家再用扩散目标输出连续的高频动作。论文称在 AgiBot World(100 台机器人采集的 100 多万条轨迹)上预训练,比用 Open X-Embodiment 平均提升 30%;GO-1 在复杂真机任务上成功率超过 60%,比 RDT 高 32%。模型 2025 年 9 月开源,同时放出去掉潜在规划器的轻量版 GO-1 Air,后继是 2026 年的 GO-2。
例子开源的 GO-1 权重放在 Hugging Face 上,官方说明推理约需 7GB 显存,全参数微调(批大小 16)约需 70GB 显存。
- 也叫
- 启元大模型、Genie Operator-1、GO-1 Air
- 相关
- ViLLA 架构、潜在动作、AgiBot World 数据集、智元 GO-2(Genie Operator-2)、动作专家、智元机器人
- 来源
- AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems (arXiv 2503.06669)
OpenDriveLab/AgiBot-World(GitHub,含 GO-1 / GO-1 Air 开源说明) - 信息截至
- 2025-09