RLinf
进阶面向具身和智能体大模型的开源大规模强化学习训练框架
RLinf 是 2025 年开源的强化学习基础设施,由清华大学等机构联合开发,目标是把大模型强化学习训练跑得又快又灵活。它把仿真、推理生成、训练等环节调度到同一批 GPU 上,按需切换或流水线并行,提高显卡利用率。在具身方向,它支持对 OpenVLA、OpenVLA-OFT、π0 等视觉-语言-动作模型在 ManiSkill、LIBERO 等仿真环境里做在线强化学习微调;也能用于大语言模型的推理类强化学习。适合想给 VLA 做强化学习后训练、又不想自己搭分布式系统的研究者。
例子用 RLinf 提供的配置,在 ManiSkill 仿真里对 OpenVLA-OFT 做 PPO 或 GRPO 强化学习微调,提升抓取放置成功率。
- 相关
- 强化学习微调、视觉-语言-动作模型、veRL、SimpleVLA-RL、ManiSkill、LIBERO
- 来源
- RLinf on GitHub
- 信息截至
- 2025-09