经验回放
Experience Replay (Replay Buffer)常用把智能体过去的交互数据存进缓冲区,训练时随机抽出来重复利用。
经验回放是强化学习里的数据复用机制,由 Long-Ji Lin 在 1990 年代初提出,2013 年 DeepMind 的 DQN(深度 Q 网络)把它和深度网络结合后广为人知。智能体每走一步,就把「状态、动作、奖励、下一状态」这条转移存进一个容量有限的缓冲区,满了就覆盖最旧的;训练时从中随机抽小批量来更新网络。好处有两点:一条数据能反复用多次,样本效率更高;随机抽样打乱了相邻步之间的强相关,训练更稳定。抽到的数据来自旧策略,所以用它的算法须是异策略(off-policy)方法,如 DQN、SAC。真机强化学习样本昂贵,更依赖它。
例子DQN 玩 Atari 游戏时回放缓冲区保存最近 100 万帧;HIL-SERL 用两个缓冲区,一个存人类演示和人工干预数据,一个存策略自己的交互数据,训练时各抽一半。
- 也叫
- 回放缓冲区、Replay Buffer、经验池、回放池
- 相关
- 异策略、深度 Q 网络、软演员-评论家、后见之明经验回放、样本效率、HIL-SERL
- 来源
- Playing Atari with Deep Reinforcement Learning (DQN, 2013)
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (HIL-SERL)