具身智能新手名词表English

VLA-Arena

VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models进阶

北大团队的开源 VLA 评测框架,按任务、语言、视觉三条轴分级测能力边界。

VLA-Arena 是北京大学 PKU-Alignment 团队发布的开源 VLA(视觉-语言-动作模型)评测框架,2025 年 12 月上线 arXiv,后被 ICML 2026 接收,仿真基于 LIBERO 和 robosuite。它把难度拆成任务结构、语言指令、视觉观测三条独立的轴:11 个任务套件共 170 个任务,分属安全、干扰物、外推、长程四类,每套分 L0–L2 三级,只许在 L0 上微调;语言(W0–W4)和视觉(V0–V4)扰动可叠加到任意任务上。作者据此发现,现有 VLA 偏向记忆训练任务、视觉理解浅、常忽视安全约束。

例子论文发现同一个模型在 L0 排名靠前、到 L1/L2 却可能被别的模型反超,作者把这种排名反转当作三级难度各自提供独立信息的证据。

也叫
VLA-Arena 基准
相关
视觉-语言-动作模型、LIBERO、robosuite、泛化与鲁棒性评测、具身安全、基准测试
来源
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models (arXiv 2512.22539)
VLA-Arena 项目主页
信息截至
2026-08

在完整名词表里查看 →