VLA-RFT
VLA-RFT: Vision-Language-Action Reinforcement Fine-tuning with Verified Rewards in World Simulators进阶在学出来的世界模型里跑强化学习,只用几百步就把 VLA 调得更稳。
VLA-RFT 由西湖大学、浙江大学、OpenHelix 团队等 2025 年 10 月提出。只靠模仿学习的 VLA 容易误差累积、遇到扰动就失败;强化学习能改善,但真机交互昂贵,传统仿真器又有虚实差距。它的做法是先用真实交互数据训练一个约 1.38 亿参数的自回归世界模型,根据当前画面和动作预测未来画面,把它当作可控的模拟器;策略在里面推演一整段轨迹,奖励由预测画面与专家参考轨迹画面之间的像素误差(L1)和感知误差(LPIPS)算出,属于可验证奖励;再用 GRPO(组相对策略优化)更新策略。基座策略是 VLA-Adapter。不到 400 步微调就超过监督微调基线,并在物体位置、初始状态等扰动下更稳健。它说明世界模型可以作为 VLA 后训练的实用环境。
例子LIBERO 上,VLA-Adapter 监督微调基线平均成功率 86.6%,在世界模型里做 400 步强化微调后提升到 91.1%。
- 也叫
- 世界模型中的 VLA 强化微调
- 相关
- 世界模型、强化学习微调、组相对策略优化、VLA-Adapter、WMPO(基于世界模型的策略优化)、想象中学习
- 来源
- VLA-RFT (arXiv 2510.00406)
VLA-RFT 项目主页 - 信息截至
- 2025-10