RECAP
RL with Experience and Corrections via Advantage-conditioned Policies常用PI 公司让 VLA 从自己的运行经验和人工纠正中持续变强的训练方法。
RECAP 是 Physical Intelligence 在 2025 年 11 月随 π*0.6 发布的训练方法。纯模仿学习最多学到演示的水平,而机器人部署后会产生大量成功、失败和人工接管的数据。RECAP 把三类数据放在一起用:离线演示、机器人自主运行的轨迹、专家在运行中遥操作介入的纠正。它先训练一个价值函数,预测离任务完成还剩多少步,据此判断每个动作比平均水平好还是差(优势),再把「Advantage: positive / negative」作为文本 token 输入策略一起训练;推理时以 positive 为条件,让模型输出更好的动作。部署、重训价值函数、微调策略可以反复迭代。在叠衣服、组装纸箱、做咖啡等任务上吞吐量翻倍以上、失败率约减半。
例子π*0.6 用 RECAP 训练后,PI 报告它能连续 13 小时制作意式咖啡,也能在陌生家庭里连续两个多小时叠没见过的衣物。
- 也叫
- π*0.6 的强化学习方法、优势条件化策略强化学习
- 相关
- π*0.6、优势条件化、价值函数、离线强化学习、人在回路、无分类器引导
- 来源
- π*0.6: a VLA That Learns From Experience (arXiv:2511.14759)
- 信息截至
- 2025-11