具身智能新手名词表English

在线强化学习

Online Reinforcement LearningOnline RL常用

边与环境交互边学习,训练中不断用最新策略采集新数据。

强化学习最经典的设定:智能体用当前策略与环境交互,拿到新数据就更新策略,再用更新后的策略继续采集,循环往复。它既包括只用最新数据的同策略方法(如 PPO),也包括把历史数据存进回放缓冲区的异策略方法(如 SAC);关键在于训练过程中能持续拿到新数据,这是它和离线强化学习的分界线。在线学习能主动探索、在自己犯的错误上改进,但需要大量交互:仿真里靠并行加速,真机上则受安全、时间和场景复位的限制。近年常见做法是先用演示或离线数据打底,再做在线强化学习微调,例如用 RL 继续提升 VLA。

例子HIL-SERL 在真机上做在线强化学习,人在旁边随时纠正,1 到 2.5 小时内让机械臂在精密装配、双臂协作等任务上达到接近满分的成功率。

相关
离线强化学习、离线到在线强化学习、真机强化学习、强化学习微调、同策略、异策略
来源
Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (Fig. 1)
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)

在完整名词表里查看 →