SmolVLA
SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (Hugging Face)常用Hugging Face 推出的约 4.5 亿参数开源小 VLA,消费级设备就能训练和运行。
SmolVLA 是 Hugging Face 的 LeRobot 团队 2025 年 6 月发布的开源视觉-语言-动作模型,约 4.5 亿参数。它以小型视觉语言模型 SmolVLM2 为骨干,后接约 1 亿参数、用流匹配训练的动作专家;为省算力,每帧图像只保留 64 个视觉 token,并跳过部分网络层。预训练只用社区上传的 487 个 LeRobot 数据集、约 1000 万帧,比常见 VLA 的数据少一个数量级。它还支持异步推理:机器人执行当前动作块时就开始算下一块,官方称任务完成快约 30%。在 LIBERO、Meta-World 和 SO-100/SO-101 真机上,它的表现接近或超过更大的模型,能在消费级显卡甚至 MacBook 上跑。
例子用 LeRobot 采一批 SO-101 机械臂抓积木的演示,在一张消费级显卡上微调 SmolVLA,再部署回同一台机械臂执行。
- 相关
- LeRobot、视觉-语言-动作模型、动作专家、流匹配、异步推理、SO-100 / SO-101 机械臂
- 来源
- SmolVLA: Efficient Vision-Language-Action Model trained on Lerobot Community Data (Hugging Face Blog)
- 信息截至
- 2025-06