π0.5
π0.5: a Vision-Language-Action Model with Open-World Generalization入门必知PI 2025 年发布的 VLA,能在没见过的真实家庭里完成收拾厨房等长程任务。
π0.5 是 Physical Intelligence 于 2025 年 4 月 22 日发布的 π0 升级版,重点是开放世界泛化:让机器人进到训练时从没去过的家里干活。做法是把多种来源的数据混在一起协同训练:约 100 个家庭里采集的约 400 小时移动机械臂数据只占预训练样本的约 2.4%,其余来自其他机器人、实验室数据、网络图文问答和高层语义标注。推理时模型先用文字预测下一步子任务(如「捡起盘子」),再据此生成底层动作,类似思维链。训练上,预训练阶段把动作压成离散的 FAST token 以提高效率,后训练再接上流匹配动作专家输出连续动作。论文在 3 个训练中未见过的真实家庭里测试,它能完成收拾厨房、整理卧室这类多步骤任务。2025 年 9 月权重已在 openpi 中开源。
例子在一个没去过的家里接到「收拾厨房」的指令,π0.5 先说出「把盘子放进水槽」这样的子任务,再执行对应动作,一步步做完。
- 也叫
- pi0.5、pi05
- 相关
- π0、协同训练、π0-FAST、开放世界、长程任务、π*0.6
- 来源
- π0.5: a Vision-Language-Action Model with Open-World Generalization (arXiv 2504.16054)
Physical-Intelligence/openpi GitHub 仓库 - 信息截至
- 2025-09