具身智能新手名词表English

样本效率

Sample Efficiency常用

学到同样水平要消耗多少数据或环境交互,用得越少效率越高。

样本效率衡量一个学习算法达到某个性能需要多少样本:强化学习里指与环境交互的步数,模仿学习里指演示条数。它在机器人上格外关键。仿真里可以靠 GPU 并行弥补,例如 Rudin 等人 2021 年在单块 GPU 上同时跑数千个 ANYmal 四足机器人,平地行走不到 4 分钟就训完;真机只能一步步实际执行,还有磨损和人工复位成本,所以真机强化学习必须用样本效率高的方法。常见提升手段有:用异策略算法配合经验回放反复利用旧数据、加入人类演示或纠正、基于模型的强化学习在想象中训练、使用预训练视觉表征。一般来说同策略的 PPO 样本效率较低,适合大规模并行仿真;SAC 一类异策略算法更省样本,常用于真机。

例子伯克利的 SERL 在真机上用异策略强化学习,每个任务平均 25–50 分钟训练就学会 PCB 板插装、线缆布线等任务;后续 HIL-SERL 加入人类纠正,1–2.5 小时即达到接近满分的成功率。

也叫
数据效率、Data Efficiency
相关
异策略、经验回放、真机强化学习、基于模型的强化学习、大规模并行强化学习、SERL
来源
SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning (arXiv 2401.16013)
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL, arXiv 2410.21845)
Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)

在完整名词表里查看 →