具身智能新手名词表English

闭环评测

Closed-loop Evaluation常用

让策略真正控制机器人、边看边做,按任务最后有没有完成来打分。

闭环评测指把策略放进仿真或真实环境里实际运行:每一步用最新观测算出动作,动作改变环境,环境再给出新观测,循环到任务成功、失败或超时,再统计成功率等指标。与之相对的开环评测只在离线数据上比较模型预测的动作和人类演示差多少(如均方误差),模型的动作不会影响后续输入。问题在于模仿学习的小误差会把机器人带进演示里没见过的状态并越积越大,离线误差看不出这一点。SimplerEnv 论文实测发现,验证集均方误差不能很好反映策略的真机表现;自动驾驶领域 CVPR 2024 的一项研究也指出开环规划指标会误导结论。因此 VLA 论文一般以仿真或真机的闭环成功率为准。

例子在 LIBERO 上测一个 VLA:每个任务从不同初始状态各跑若干回合,策略实时控制仿真机械臂,最后报告成功率,这是闭环评测;只算它在测试集上预测动作的均方误差,则属于开环评测。

也叫
闭环测试、在线评测
相关
开环评测、仿真评测、真机评测、推演、复合误差、SimplerEnv
来源
Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, arXiv 2405.05941)
Is Ego Status All You Need for Open-Loop End-to-End Autonomous Driving? (arXiv 2312.03031)

在完整名词表里查看 →