具身智能新手名词表English

基准饱和

Benchmark Saturation进阶

主流模型在某个基准上分数都接近满分,它再也分不出方法好坏。

基准测试(固定任务和评测协议的公共考卷)用久了,各家分数会逼近上限,差距只剩一两个百分点,甚至落在随机误差内,这就是饱和。原因可能是方法确实进步了,也可能是大家反复针对同一测试集调参,或测试场景和训练数据太像、模型靠记忆就能拿高分。NLP 领域的 Dynabench 论文(2021)就指出,模型很快在基准上取得出色成绩,却在简单的挑战样例上失败。具身领域的典型例子是 LIBERO:多款 VLA 在标准设定下成功率已超过 90%。饱和后社区通常会推出更难或加扰动的新版本,或转向真机评测、泛化与鲁棒性评测。在饱和基准上的小幅领先,说服力有限。

例子LIBERO-PRO(2025)指出,模型在标准 LIBERO 上成功率超过 90%,但在替换物体、改初始状态、改指令、换环境等设定下成功率跌到 0.0%,说明高分很大程度来自对训练轨迹和场景布局的记忆。

也叫
榜单刷满、基准测试饱和
相关
基准测试、LIBERO、LIBERO-PRO、LIBERO-Plus、刷榜、泛化与鲁棒性评测
来源
LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization (arXiv 2510.03827)
Dynabench: Rethinking Benchmarking in NLP (arXiv 2104.14337)
Stanford HAI: The 2025 AI Index Report
信息截至
2025-10

在完整名词表里查看 →