具身智能新手名词表English

NaVILA

NaVILA: Legged Robot Vision-Language-Action Model for Navigation进阶

足式机器人导航 VLA:大模型用文字给出中层动作,强化学习运控负责走。

NaVILA 由加州大学圣地亚哥分校王小龙团队与英伟达、南加州大学提出,2024 年 12 月上 arXiv,发表于 RSS 2025。视觉语言模型擅长理解画面和指令,但直接输出腿部关节指令很难,于是 NaVILA 分两层:上层是在英伟达 VILA(8B)上微调的 VLA,看相机画面和指令,用文字输出带距离、角度的中层动作,如「前进 75 厘米」;下层是强化学习训练的运动策略,读激光雷达生成的高度图,把中层动作变成四足 12 个关节的指令。训练数据除仿真导航数据外,还有约 2000 段 YouTube 第一人称游览视频。它在 R2R-CE 上成功率 54%,论文还发布了基于 Isaac Lab 的 VLN-CE-Isaac 基准。

例子在办公区、家庭和户外共 25 条指令的真机测试中,装在宇树 Go2 四足上的 NaVILA 成功率 88%,多房间复杂指令为 75%;同一模型不重新训练也能用在 Booster T1 人形上。

相关
视觉语言导航、视觉-语言-动作模型、腿足运动、分层架构、强化学习运控、NaVid
来源
NaVILA: Legged Robot Vision-Language-Action Model for Navigation (arXiv 2412.04453)
NaVILA 项目页
信息截至
2025-06

在完整名词表里查看 →