Mobility VLA
Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs进阶用长上下文 VLM 看懂一段导览视频,再按图文指令找到目的地的分层导航系统
Google DeepMind 在 2024 年 7 月发布。它针对的任务叫 MINT(带演示导览的多模态指令导航):先有人拿着相机把环境走一遍录成导览视频,之后用户可以用文字加图片下指令,比如拿着一样东西问「这个该还到哪」。系统分两层:高层用上下文长达 100 万 token 的 Gemini 1.5 Pro 读完整段导览视频和指令,找出目标所在的那一帧;低层用 COLMAP(一种从图像恢复相机位姿的工具)由视频建出拓扑图,即把地点当节点、可通行关系当边的地图,据此生成路点动作交给底盘执行。在 836 平方米、有人办公的真实办公室里,需推理类和多模态类指令的端到端成功率分别为 86% 和 90%。
例子用户拿着一个充电器问「这个应该放回哪里」,机器人先在导览视频里找到放充电器的那张桌子,再沿拓扑图一路开过去。
- 也叫
- MINT (Multimodal Instruction Navigation with demonstration Tours)
- 相关
- 视觉语言导航、拓扑地图、分层架构、Gemini 系列(谷歌多模态大模型)、上下文长度、运动恢复结构
- 来源
- Mobility VLA (arXiv 2407.07775)
Mobility VLA (arXiv HTML full text) - 信息截至
- 2024-07