具身智能新手名词表English

LIBERO-PRO

LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization进阶

给 LIBERO 加物体、位置、指令、环境扰动,检验 VLA 是否在死记硬背。

LIBERO-PRO 是 2025 年 10 月由华中科技大学、哈佛、MIT、理海大学等团队发布的扩展评测基准。作者指出,LIBERO 的训练和测试场景几乎相同,模型记住动作序列和桌面布局就能拿高分,分数虚高,也难以公平比较。LIBERO-PRO 在操作物体、初始状态、任务指令和环境四个维度上加入合理扰动,可自由组合。结果显示,标准设定下成功率超过 90% 的模型,在泛化设定下可跌到 0%:目标物被换成无关物品时仍照常去抓,指令被改乱甚至换成乱码时动作几乎不变。它与 LIBERO-Plus 同期出现,都说明 LIBERO 已接近基准饱和。

例子项目主页公布:OpenVLA 在原任务上成功率 0.98,物体位置扰动后为 0.00;π0.5 从 0.97 降到 0.38。

相关
LIBERO、LIBERO-Plus、基准饱和、泛化与鲁棒性评测、分布外、刷榜
来源
LIBERO-PRO: Towards Robust and Fair Evaluation of VLA Models Beyond Memorization (arXiv 2510.03827)
LIBERO-PRO GitHub 仓库
信息截至
2025-10

在完整名词表里查看 →