VLA-Arena
VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models进阶北大团队的开源 VLA 评测框架,按任务、语言、视觉三条轴分级测能力边界。
VLA-Arena 是北京大学 PKU-Alignment 团队发布的开源 VLA(视觉-语言-动作模型)评测框架,2025 年 12 月上线 arXiv,后被 ICML 2026 接收,仿真基于 LIBERO 和 robosuite。它把难度拆成任务结构、语言指令、视觉观测三条独立的轴:11 个任务套件共 170 个任务,分属安全、干扰物、外推、长程四类,每套分 L0–L2 三级,只许在 L0 上微调;语言(W0–W4)和视觉(V0–V4)扰动可叠加到任意任务上。作者据此发现,现有 VLA 偏向记忆训练任务、视觉理解浅、常忽视安全约束。
例子论文发现同一个模型在 L0 排名靠前、到 L1/L2 却可能被别的模型反超,作者把这种排名反转当作三级难度各自提供独立信息的证据。
- 也叫
- VLA-Arena 基准
- 相关
- 视觉-语言-动作模型、LIBERO、robosuite、泛化与鲁棒性评测、具身安全、基准测试
- 来源
- VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models (arXiv 2512.22539)
VLA-Arena 项目主页 - 信息截至
- 2026-08