字节 GR-2
GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation (ByteDance)GR-2进阶字节跳动 2024 年的第二代操作模型,先在 3800 万段网络视频上预训练。
GR-2 由字节跳动研究团队 2024 年 10 月发布,是 GR-1 的升级版,作者称之为「视频-语言-动作模型」。第一阶段在 3800 万段互联网视频(超过 500 亿 token)上做视频生成预训练,数据来自 Howto100M、Ego4D、Something-Something V2、EPIC-KITCHENS 等人类日常视频,让模型学会画面接下来会怎么变;第二阶段用机器人轨迹微调,同时预测未来画面和动作轨迹。图像用 VQGAN 切成离散 token,动作轨迹由条件变分自编码器(CVAE)生成。报告称它在 100 多个任务上平均成功率 97.7%,对新背景、新环境、新物体和新任务的泛化也较强。真机部署在 Kinova Gen3 机械臂上,配合轨迹优化和实时跟踪的全身控制算法执行动作。
例子在工业无序抓取实验中,要从杂乱料箱里挑出指定物品,覆盖 122 种物体(其中 67 种训练时没见过),GR-2 平均成功率 79.0%,GR-1 只有 33.3%。
- 也叫
- 字节跳动 GR-2
- 相关
- 字节 GR-1、字节 GR-3、视频生成模型、人类视频预训练、条件变分自编码器、无序抓取
- 来源
- GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation (arXiv 2410.06158)
GR-2 论文 HTML 全文 - 信息截至
- 2024-10