具身智能新手名词表English

Hi Robot

Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models进阶

PI 2025 年的分层系统:高层 VLM 拆解复杂指令,低层 π0 执行。

Hi Robot 由 Physical Intelligence 联合斯坦福大学、UC 伯克利的研究者 2025 年 2 月发布,发表于 ICML 2025。单个 VLA 擅长执行「拿起杯子」这类简单指令,但难以处理带限制条件的复杂要求,也难以应对执行途中用户的插话纠正。Hi Robot 分两层:高层是基于 PaliGemma-3B 的视觉语言模型,看当前画面和用户的话,推理出下一步该执行的简单指令,还能口头回应用户;低层是 π0,把简单指令变成连续动作。训练高层时,团队把遥操作示范切成短技能片段,再让一个大 VLM 反推「用户当时可能说了什么、机器人该怎么回答」,合成对话式训练数据,省去人工标注。系统在单臂 UR5e、双臂 ARX 和移动双臂 ARX 上做了测试。

例子用户说「给我做个素食三明治」,高层会把它拆成逐步取配料的子指令并跳过肉类;收拾桌子时用户说「那不是垃圾」,机器人会停下并调整做法。

也叫
Hierarchical Interactive Robot
相关
分层架构、快慢双系统、π0、指令跟随、语言纠正(实时语言反馈)、Physical Intelligence
来源
Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models (arXiv 2502.19417)
Hi Robot 论文 HTML 全文
信息截至
2025-07

在完整名词表里查看 →