X-VLA
X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model进阶给每个数据源配专属「软提示」来统一多种机器人的 0.9B 跨本体 VLA
清华大学智能产业研究院(AIR)与上海人工智能实验室等 2025 年 10 月提出,已被 ICLR 2026 接收。跨本体训练的难点是不同机器人的相机、动作空间差别大,混在一起训练会互相干扰。X-VLA 给每个数据来源配一组可学习的嵌入向量作为「软提示」,告诉模型当前是哪种硬件,其余主干全部共享;动作用流匹配生成,主干是标准 Transformer 编码器。0.9B 参数版本在 DROID、RoboMIND、AgiBot 共 29 万条轨迹上预训练,在 LIBERO、SimplerEnv、CALVIN 等 6 个仿真基准和 3 个真机平台上取得领先。代码以 Apache-2.0 开源,并已接入 LeRobot。
例子真机叠衣服任务(Soft-Fold)中,X-VLA-0.9B 报告成功率 100%、每小时叠 33 件。
- 也叫
- X-VLA-0.9B
- 相关
- 跨本体、提示微调 / 软提示、流匹配、视觉-语言-动作模型、LeRobot、跨本体数据
- 来源
- X-VLA (arXiv:2510.10274)
2toinf/X-VLA (GitHub) - 信息截至
- 2026-09