泛化与鲁棒性评测
Generalization / Robustness Evaluation (Perturbation Test)常用故意改变光照、位置、物体、指令等条件,测策略离开训练环境后还剩几成本事。
泛化与鲁棒性评测不只报告策略在训练同分布条件下的成功率,而是系统地施加扰动:换物体颜色和形状、加干扰物、改光照和背景、挪相机视角、改机器人初始姿态、改写语言指令、加传感器噪声等,再看成功率掉多少。它回答的问题是:高分到底是学会了任务,还是只记住了训练场景。常见做法是按维度逐一施加扰动以定位弱点,也会把多种扰动叠加。代表基准有 The Colosseum、LIBERO-Plus、LIBERO-PRO,SimplerEnv 的变体聚合也属于这一思路。这类评测常显示,标准基准上接近满分的模型在轻度扰动下成功率大幅下降。
例子LIBERO-Plus 在 LIBERO 上从物体布局、相机视角、机器人初始状态、语言指令、光照、背景纹理、传感器噪声 7 个维度加扰动,发现部分 VLA 成功率会从 95% 跌到 30% 以下,而且模型常常忽略语言指令。
- 也叫
- 扰动测试、分布外评测、OOD Evaluation、鲁棒性基准
- 相关
- 泛化、鲁棒性、分布外、干扰物、LIBERO-Plus、The Colosseum
- 来源
- THE COLOSSEUM: A Benchmark for Evaluating Generalization for Robotic Manipulation (arXiv 2402.08191)
LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models (arXiv 2510.13626) - 信息截至
- 2025-12