具身智能新手名词表English

OpenEQA 开放词汇具身问答基准

OpenEQA (Open-Vocabulary Embodied Question Answering Benchmark)进阶

Meta 推出的具身问答基准,考智能体能否凭对真实环境的观察用自然语言答题。

OpenEQA 由 Meta FAIR 于 2024 年 4 月发布,论文发表于 CVPR 2024。具身问答(EQA)要求智能体理解自己所处或曾经看过的环境,并用自然语言回答,比如「我把钥匙放哪了」。它包含 1600 多个人工撰写、非模板生成的问答对,对应 180 多个真实环境的视频和扫描,场景来自 HM3D 和 ScanNet。设有两种设定:情景记忆 EM-EQA,根据已录下的观察历史作答,对应智能眼镜;主动探索 A-EQA,机器人需要自己移动去收集信息。由于答案是开放词汇的自由文本,作者用大语言模型打分的 LLM-Match 指标自动评估,与人工评判高度相关。

例子Meta 公布的结果中,GPT-4V 准确率为 48.5%,人类为 85.9%;在需要空间理解的问题上,能看图的模型并不比只读文字的模型强多少。

也叫
OpenEQA、EM-EQA、A-EQA
相关
具身问答、视觉问答、开放词汇、具身记忆、HM3D 数据集、ScanNet 数据集
来源
Meta AI Blog: OpenEQA: From word models to world models
OpenEQA project page
GitHub: facebookresearch/open-eqa (data)
信息截至
2024-04

在完整名词表里查看 →