π0
π0 (pi-zero): A Vision-Language-Action Flow Model for General Robot Control入门必知Physical Intelligence 2024 年发布的 VLA,用流匹配生成连续动作,已开源。
π0 是美国具身智能公司 Physical Intelligence(PI)于 2024 年 10 月 31 日发布的通用机器人基础模型。它以谷歌 30 亿参数的视觉语言模型 PaliGemma 为底座,外加一个约 3 亿参数的「动作专家」,用流匹配(和扩散模型类似、从噪声逐步生成连续值的方法)一次生成未来 50 步动作,控制频率最高 50Hz。与 RT-2、OpenVLA 把动作离散成 token 不同,连续生成更适合叠衣服这类高频灵巧任务。它用 1 万多小时机器人数据预训练,覆盖 7 种机器人构型、68 个任务,并混入 OXE、DROID 等开源数据;预训练后可直接按语言指令做事,也能用少量数据微调学新技能。PI 后来在 openpi 仓库开源了代码和权重,单张 RTX 4090 即可推理和做 LoRA 微调。
例子论文演示中,π0 经微调后能把烘干机里的衣服取出、拿到桌边逐件叠好,还能组装纸箱、收拾餐桌。
- 也叫
- pi0、pi-zero、π-zero
- 相关
- 流匹配、动作专家、PaliGemma、π0.5、π0-FAST、Physical Intelligence
- 来源
- π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)
Physical-Intelligence/openpi GitHub 仓库 - 信息截至
- 2025-09