蚂蚁灵波 LingBot-VLA
LingBot-VLA (A Pragmatic VLA Foundation Model, Robbyant / Ant Group)进阶蚂蚁灵波开源的 VLA 基础模型,用约 2 万小时双臂真机数据预训练。
LingBot-VLA 是蚂蚁灵波(Robbyant)2026 年 1 月开源的视觉-语言-动作(VLA)基础模型,论文题为 A Pragmatic VLA Foundation Model,强调实用:泛化好、适配新平台的数据和算力成本低。它以 Qwen2.5-VL-3B 为视觉语言骨干(也支持 PaliGemma),用 9 种主流双臂构型约 20,000 小时真机数据预训练,并在智元 G1、松灵、星海图 R1Pro 等 4 个平台上各跑 100 个任务(GM-100)做系统评测。配套训练代码 8 卡吞吐每秒 261 个样本,比已有 VLA 代码库快 1.5–2.8 倍。2026 年 7 月的 2.0 版把数据扩到约 6 万小时(含 1 万小时人类第一视角视频),动作扩展到头、腰、底盘和灵巧手。
例子在 GM-100 评测里,每个任务只给 130 条后训练演示,再比较它与其他 VLA 在同一真机平台上的成功率。
- 也叫
- LingBot-VLA、LingBot-VLA 2.0
- 相关
- 视觉-语言-动作模型、通义千问 Qwen-VL、跨本体、后训练、π0、蚂蚁灵波
- 来源
- arXiv 2601.18692: A Pragmatic VLA Foundation Model
Robbyant 官网:LingBot-VLA
arXiv 2607.06403: From Foundation to Application (LingBot-VLA 2.0) - 信息截至
- 2026-07