具身智能新手名词表English

银河通用 NavFoM

NavFoM: Embodied Navigation Foundation Model (Galbot)NavFoM进阶

银河通用与北大 2025 年推出的导航基座模型,一套权重适配多种本体和导航任务。

NavFoM 由银河通用联合北京大学、阿德莱德大学、浙江大学等提出,论文 2025 年 9 月上 arXiv,11 月公司正式发布,宣传为「全球首个跨本体全域环视导航基座大模型」。以往导航模型多是一种机器人、一种任务单独训练;NavFoM 用 802 万条导航样本(四足、无人机、轮式机器人、汽车)加 476 万条图文和视频问答数据,同时学指令导航、找物体、目标跟踪和自动驾驶。它以 Qwen2-7B 为语言骨干,拼接 DINOv2 和 SigLIP 视觉特征,用特殊 token 标明每帧来自哪台相机、哪个时刻,可接 1 到 8 路相机,最后由 MLP 输出路径点,交给本体的局部规划器执行。

例子同一套权重不做针对性微调,就在 VLN-CE 指令导航、HM3D-OVON 开放词汇找物、EVT-Bench 目标跟踪和 NAVSIM 自动驾驶等基准上评测;北大与银河通用后来的 UrbanVLA 也在它的基础上训练。

也叫
导航基座大模型、Embodied Navigation Foundation Model
相关
跨本体、视觉语言导航、具身视觉跟踪(目标跟随)、银河通用 TrackVLA、NaVid、银河星脑 AstraBrain
来源
Embodied Navigation Foundation Model (arXiv 2509.12129)
NavFoM 项目页
银河通用发布全球首个跨本体全域环视导航大模型NavFoM(网易,2025-11-05)
信息截至
2025-11

在完整名词表里查看 →