利用先验数据的强化学习
Reinforcement Learning with Prior DataRLPD进阶在线强化学习时把离线数据和新采数据各取一半混合训练的简单高效方法。
RLPD 是 Ball、Smith、Kostrikov、Levine 在 ICML 2023 提出的方法,研究手里已有离线数据(专家演示或大量次优轨迹)时,上线交互学习该怎么用好它们。作者发现不需要复杂的离线预训练,只要在异策略算法 SAC 上做几处小改动:每个训练批次一半取离线数据、一半取在线回放缓存(对称采样);给评论家网络加层归一化,防止把没见过动作的价值估高;用 10 个评论家组成集成并提高更新-数据比。论文报告在多个基准上比已有方法提升约 2.5 倍。真机强化学习框架 SERL 以它为核心算法。
例子SERL 在真机上用 RLPD 训练:人类演示放进离线缓冲区,机器人自己交互产生的数据放进在线缓冲区,每个训练批次两边各取一半。
- 也叫
- Efficient Online Reinforcement Learning with Offline Data
- 相关
- 离线到在线强化学习、软演员-评论家、更新-数据比、经验回放、SERL、HIL-SERL
- 来源
- Ball et al. 2023: Efficient Online Reinforcement Learning with Offline Data (RLPD)
GitHub: ikostrikov/rlpd
Luo et al. 2024: SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning