具身智能新手名词表English

场景理解

Scene Understanding常用

从图像、深度或点云中弄清环境里有什么、在哪里、彼此是什么关系。

场景理解是计算机视觉和机器人感知的总目标,不是单一算法:从图像、深度或点云里弄清场景的几何(物体在哪、多大、哪里能走)、语义(是什么)和关系(杯子在桌上、抽屉能拉开)。它由目标检测、语义与实例分割、深度估计、三维重建、位姿估计、可供性检测等任务拼成。机器人要在三维空间里导航和操作,所以具身智能更关心 3D 场景理解:ScanNet(2017)提供 1513 个室内场景、约 250 万帧 RGB-D 数据及语义标注;ConceptGraphs(2023)把 2D 基础模型的结果多视角融合成开放词汇 3D 场景图,供大模型按语言指令做规划。

例子家务机器人进厨房后先建一张 3D 场景图:冰箱、餐桌、桌上的两只碗、碗在桌面上;接到「把碗放进水槽」时,据此查出碗和水槽的三维位置再规划动作。

也叫
3D 场景理解、3D Scene Understanding
相关
3D场景图、语义地图、3D视觉、语义分割、ConceptGraphs、ScanNet 数据集
来源
ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes (arXiv 1702.04405)
ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning (arXiv 2309.16650)

在完整名词表里查看 →