Embodied Arena 具身评测竞技场
Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI进阶统一接入具身问答、导航、任务规划基准并实时排榜的评测平台
Embodied Arena 是天津大学、华为诺亚方舟实验室等国内外十余家机构联合推出的具身智能评测平台,论文 2025 年 9 月发布在 arXiv。它针对的问题是:具身领域基准很多但各自为政,模型之间难以横向比较,也说不清具身智能到底需要哪些能力。平台先定义一套能力分类:感知、推理、任务执行三层,7 项核心能力、25 个细分维度;再用统一的评测底座接入 22 个已有基准,覆盖 2D/3D 具身问答(如 OpenEQA、VSI-Bench、ERQA)、导航(如 R2R-CE、HM3D)和任务规划(如 EB-ALFRED、EB-Habitat),评测 20 多家机构的 30 多个模型;还用大语言模型驱动的流水线自动生成新评测数据,让题库持续更新。结果发布成三个实时排行榜,可按基准看,也可按能力维度看。
例子想了解某个多模态大模型的空间推理水平,可以直接看 Embodied Arena 能力视图里该维度的综合得分,不用自己分别跑 VSI-Bench、ERQA 等多个基准。
- 也叫
- Embodied Arena
- 相关
- 基准测试、EmbodiedBench、ERQA 具身推理问答基准、OpenEQA 开放词汇具身问答基准、VSI-Bench 空间智能基准、具身问答
- 来源
- Embodied Arena (arXiv 2509.15273)
Embodied Arena 论文 HTML 版(作者单位与基准列表) - 信息截至
- 2025-09