RIPT-VLA(交互式后训练)
RIPT-VLA: Interactive Post-Training for Vision-Language-Action Models进阶只用成功/失败二值奖励,对预训练 VLA 做强化学习后训练的方法
UT Austin 的 Shuhan Tan、Philipp Krähenbühl 等人 2025 年 5 月发布。VLA 通常先预训练、再用专家演示监督微调,但演示少时效果差。RIPT-VLA 加了第三步「交互式后训练」:让模型在环境里反复尝试,只用任务成败的二值奖励做强化学习。它对同一初始状态采样多次,以同组其他尝试的平均成绩为基线估计优势(留一法),再用 PPO 更新;全成或全败的组没有学习信号,就丢弃重采。它把 QueST 模型提升 21.2%,把 7B 的 OpenVLA-OFT 在 LIBERO 上推到 97.5%;只给 1 条演示时,能把 4% 成功率的模型在 15 轮迭代内提到 97%。
例子只用 1 条演示微调出的 VLA 成功率仅 4%,接着让它在仿真里自己反复尝试、按成败打分,15 轮迭代后成功率升到 97%。
- 也叫
- RIPT、Reinforcement Interactive Post-Training
- 相关
- 强化学习微调、后训练、OpenVLA-OFT、LIBERO、近端策略优化、SimpleVLA-RL
- 来源
- Interactive Post-Training for Vision-Language-Action Models (arXiv 2505.17016)
- 信息截至
- 2025-05