π*0.6
π*0.6: a VLA That Learns From Experience (π0.6 trained with RECAP)常用π0.6 经 RECAP 强化学习训练后的版本,能从示教、纠正和自身经验中变强。
π*0.6 是 Physical Intelligence 2025 年 11 月发布的视觉-语言-动作模型。底座 π0.6 在 π0.5 基础上换用 Gemma 3 4B 视觉语言骨干,动作专家增至 8.6 亿参数;星号表示又用 RECAP 方法做了强化学习。只模仿人类示教的模型犯一个小错就会越偏越远(复合误差),很难稳定成功。RECAP 同时用三类数据:人类示教、专家遥控接管时的纠正、机器人自己跑出的成功和失败。它先训练一个价值函数,估计「离完成还差多少步」,据此判断每段动作让局面变好还是变坏(优势),再把「Advantage: positive / negative」作为文字条件和数据一起训练模型,部署时只让它做「好」的动作。最难的任务上吞吐量提升一倍以上,失败率约减半。
例子经过 RECAP 训练后,π*0.6 连续 13 小时做意式咖啡,在一户新家庭里不间断地叠没见过的衣物两个多小时,还在工厂里组装真实用于包装的纸盒。
- 也叫
- π0.6、pi0.6、pi*0.6、pi-star-0.6
- 相关
- RECAP、视觉-语言-动作模型、强化学习微调、优势条件化、价值函数、Physical Intelligence
- 来源
- π*0.6: a VLA That Learns From Experience (arXiv 2511.14759)
π*0.6: a VLA that Learns from Experience (Physical Intelligence blog) - 信息截至
- 2025-11