OpenVLA-OFT
OpenVLA-OFT (Optimized Fine-Tuning recipe for VLAs)OFT常用斯坦福提出的 VLA 微调配方,让 OpenVLA 动作生成快 26 倍、成功率更高。
OpenVLA-OFT 是斯坦福 Moo Jin Kim、Chelsea Finn、Percy Liang 在 2025 年 2 月提出的 VLA 微调配方。原版 OpenVLA 把动作离散成 token 逐个自回归输出,推理慢,难做高频控制。OFT 在微调时改了四处:并行解码(一次前向算出全部动作)、动作分块(一次预测多步)、连续动作表示、L1 回归损失;OFT+ 再加 FiLM 特征调制,加强对语言指令的跟随。结果 LIBERO 平均成功率从 76.5% 提到 97.1%,动作生成吞吐提升 26 倍,在 ALOHA 双臂真机上也胜过 π0、RDT-1B 等微调后的 VLA。它常被当作 VLA 微调的强基线。
例子在 LIBERO 上微调 OpenVLA 时,把输出从逐个吐出的离散动作 token 改成一次前向回归出一整段连续动作,推理吞吐大幅提升,成功率也更高。
- 也叫
- OFT、OpenVLA-OFT+、VLA 优化微调配方
- 相关
- OpenVLA、视觉-语言-动作模型、动作分块、并行解码、FiLM 特征调制、LIBERO
- 来源
- OpenVLA-OFT 项目主页
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (arXiv:2502.19645) - 信息截至
- 2025-04