具身智能新手名词表English

导航世界模型

Navigation World Models (Meta)NWM进阶

Meta 2024 年底提出的导航用视频世界模型,按动作想象走过去会看到什么。

导航世界模型由 Meta FAIR 的 Amir Bar、Yann LeCun 等与纽约大学、伯克利合作提出,2024 年 12 月上 arXiv,获 CVPR 2025 最佳论文荣誉提名。它是一个可控的视频生成模型:给定过去的画面和一段导航动作(往哪走、转多少),预测接下来会看到的画面。模型是 10 亿参数的条件扩散 Transformer(CDiT),用人类和机器人的第一人称视频训练。有了它,机器人可以先在模型里模拟多条路线,挑能到达目标的那条;也能给 NoMaD 等现成策略采样的轨迹打分排序;还能只凭一张照片想象在陌生环境里行走。作者也指出,在陌生环境里生成久了,画面会逐渐偏向训练数据。

例子给定起点照片和一张目标照片,NWM 对一批候选动作序列逐条生成沿途画面,选终点画面最接近目标照片的那条去执行。

相关
世界模型、视频预测模型、扩散 Transformer、NoMaD、图像目标导航、Meta FAIR
来源
Navigation World Models (arXiv 2412.03572)
Navigation World Models 项目页
信息截至
2025-06

在完整名词表里查看 →