具身智能新手名词表English

评测统计显著性(置信区间 / 序贯检验 / 多随机种子)

Statistical Rigor in Policy Evaluation (Confidence Intervals / Sequential Testing / Multiple Seeds)进阶

用统计方法判断策略之间的成功率差距是真提升还是运气。

机器人策略评测往往只跑几十次试验,成功率本身带着很大的随机误差:20 次成功 14 次,按常用的 Wilson 方法算,95% 置信区间约为 48%–85%。统计严谨的评测要求报告置信区间或贝叶斯后验,不能只给一个百分比;强化学习还要用多个随机种子重复训练,因为同一算法换个种子,结果可能差很多。Agarwal 等人在 NeurIPS 2021 的论文里建议报告区间估计、用四分位均值汇总多任务结果,并开源了 rliable 库。序贯检验是边做试验边检验,差距已经足够明显就提前停下,省掉昂贵的真机试验。丰田研究院 2024 年也撰文呼吁机器人学习按实验科学的标准做评测:写清实验条件、配合多种指标、做统计分析。

例子丰田研究院 2025 年的大行为模型论文里,每个真机任务每个策略跑 50 次、仿真任务跑 200 次,评测员不知道在测哪个策略;结果用 Beta 先验下的贝叶斯后验展示,策略两两比较用序贯假设检验,并做 Bonferroni 校正控制多重比较。

也叫
统计严谨评测、评测的统计显著性
相关
成功率、评测协议、随机种子与可复现性、双盲成对比较、真机评测、推演
来源
Deep Reinforcement Learning at the Edge of the Statistical Precipice (arXiv 2108.13264, NeurIPS 2021)
Robot Learning as an Empirical Science: Best Practices for Policy Evaluation (arXiv 2409.09491)
A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation (TRI, arXiv 2507.05331)
信息截至
2025-07

在完整名词表里查看 →