开环评测
Open-loop Evaluation常用不让策略真去控制,只在离线数据上比预测动作和演示动作差多少。
开环评测指不让策略真正驱动机器人,而是在离线数据集上逐帧喂入录好的观测,比较模型预测动作和演示动作差多少,常用均方误差(MSE)或 L2 误差。它便宜、快、可复现,不需要机器人或仿真器。问题是策略输出不影响下一帧画面,测不到误差累积和出错后的纠正;同一场景本有多种正确做法(动作多峰性),偏离演示也会被扣分。SIMPLER 论文(2024)比较 6 个检查点,验证集 MSE 与真机成功率的皮尔逊相关只有 0.308,闭环仿真评测则达 0.924。自动驾驶也有类似反思:CVPR 2024 一篇论文发现,在 nuScenes 开环规划指标上只用自车速度等状态就能拿到相当成绩。所以开环指标多用于调试初筛。
例子在 DROID 或自采数据的验证集上,把每一帧图像和指令输入 VLA,计算输出动作与演示动作的均方误差,用来粗看训练有没有跑偏。
- 也叫
- 离线指标评测、离线评测、Offline Evaluation
- 相关
- 闭环评测、开环、仿真评测、真机评测、SimplerEnv、仿真-真机相关性
- 来源
- Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)
Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving? (arXiv 2312.03031)