VLA-RL
VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning进阶用在线强化学习继续提升自回归 VLA(如 OpenVLA)的早期框架。
VLA-RL 由清华大学深圳国际研究生院与南洋理工大学的研究者 2025 年 5 月提出,代码开源。靠模仿演示训练的 VLA 只见过有限状态,一出分布就容易失败;VLA-RL 让预训练好的自回归 VLA 在环境里自己试错、在线改进。它把一次机器人操作轨迹看成多轮多模态对话,用 PPO(近端策略优化)做轨迹级强化学习;为缓解稀疏奖励,把一个视觉语言模型微调成机器人过程奖励模型,训练标签来自自动切分出的任务片段(以夹爪稳定时刻等为关键帧)。工程上还用了课程式选任务、GPU 负载均衡的并行环境、批量解码和价值网络预热等技巧。它是较早系统展示「VLA + 在线 RL」可行性的工作之一,作者还观察到增加测试时优化能继续提升效果。
例子在 LIBERO 的 40 个操作任务上,VLA-RL 把 OpenVLA-7B 的平均成功率从 76.5% 提到 81.0%,与 π0-FAST 相当。
- 相关
- 强化学习微调、近端策略优化、奖励模型、OpenVLA、LIBERO、SimpleVLA-RL
- 来源
- VLA-RL (arXiv 2505.18719)
GuanxingLu/vlarl (GitHub) - 信息截至
- 2025-05