空间推理
Spatial Reasoning常用判断物体位置、距离、大小、方向及相互关系的能力。
指模型根据图像或视频回答「杯子在盘子左边吗」「两个物体相距多远」这类问题,涵盖相对方位、度量距离、大小比较、视角变换等。它是机器人把语言指令落到具体位置和动作上的前提。多模态大模型擅长识别「是什么」,对「在哪、多远」普遍较弱。谷歌 SpatialVLM(2024)用自动管线从 1000 万张真实图片生成 20 亿条带度量信息的空间问答训练 VLM;Thinking in Space(2024,李飞飞、谢赛宁等)提出含 5000 多道题的 VSI-Bench,发现现有模型明显不如人,而让模型先显式画出「认知地图」能提升距离判断。
例子指令「把离你最近的红杯子放到碗的右边」,模型需先估计几个杯子离机器人的距离,再确定碗的右侧在画面中对应哪块区域。
- 也叫
- 空间理解、Spatial Understanding、三维空间推理
- 相关
- 空间智能、具身推理、SpatialVLM、VSI-Bench 空间智能基准、视觉语言模型、3D视觉定位
- 来源
- SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces (VSI-Bench) - 信息截至
- 2024-12