具身智能新手名词表English

3D-LLM

3D-LLM: Injecting the 3D World into Large Language Models进阶

能直接输入 3D 场景特征、回答空间问题和做任务分解的大语言模型。

3D-LLM 由洪一宁、淦创(Chuang Gan)等来自 UCLA、UMass Amherst、MIT 等机构的研究者在 2023 年 7 月提出,NeurIPS 2023 spotlight。大语言模型和视觉语言模型只处理文字或 2D 图片,对空间关系、布局这类三维概念把握不好。3D-LLM 把 3D 场景从多个视角渲染成图片,用 2D 特征提取器取特征再映射回 3D 点,得到带语义的 3D 特征,然后接到 BLIP-2 等现成视觉语言模型上训练;另加 3D 定位机制帮模型理解位置。作者设计三类提示方法,收集了 30 多万条 3D-语言数据,覆盖场景描述、3D 问答、任务分解、定位和导航。在 ScanQA 上 BLEU-1 比当时最好方法高 9%。它是较早把 3D 场景接入大模型的工作,后来的 3D VLA、LEO 等延续了这一方向。

例子给 3D-LLM 一个房间的 3D 扫描,问「冰箱在沙发的哪一侧」,或让它把「做早餐」分解成走到厨房、打开冰箱、拿出鸡蛋等步骤。

也叫
3D 大语言模型
相关
3D VLA、多模态大语言模型、空间推理、3D视觉定位、LEO(3D 具身通才智能体)、ScanNet 数据集
来源
3D-LLM: Injecting the 3D World into Large Language Models (arXiv 2307.12981)
3D-LLM 代码仓库 (GitHub)
信息截至
2023-12

在完整名词表里查看 →