Elo 评分
Elo Rating (Bradley-Terry Model)常用用两两对比的胜负结果,估算每个选手或策略相对实力的打分方法。
Elo 评分由物理学教授、国际象棋大师 Arpad Elo 为棋手排名设计,1960 年被美国棋协采用。每个选手有一个分数,分差决定预期胜率;每局结束后按「实际结果 − 预期结果」乘以系数 K 调整分数。数学上它是 Bradley-Terry 模型的特例,BT 模型把 A 胜 B 的概率写成两者能力差的 sigmoid。具身领域用它解决「不同实验室、不同任务的成功率没法直接比」的问题:让两个策略在同一任务上成对比较,汇总大量胜负就能排出榜单。RoboArena 发现任务难度不一会让普通 Elo 排名失真,改用加入任务难度参数的 BT 模型。
例子RoboArena 让各地评测者在自选任务上双盲比较两个策略、判断哪个做得更好,再用改进的 Bradley-Terry 模型把 600 多次真机对比汇总成 7 个通用策略的排名。
- 也叫
- Bradley-Terry 模型、BT 模型、Elo Rating System
- 相关
- 双盲成对比较、RoboArena、真机评测、成功率、基准测试
- 来源
- RoboArena: Distributed Real-World Evaluation of Generalist Robot Policies (arXiv 2506.18123)
Elo rating system - Wikipedia - 信息截至
- 2025-11