异策略
Off-Policy常用用来学习的数据可以来自别的策略,不必由当前策略亲自采集。
强化学习里区分两种策略:行为策略负责与环境交互、产生数据,目标策略是正在学习和优化的那个。两者可以不同,就叫异策略学习。这样,旧版本策略的经验、人类演示、其他算法的数据都能存进经验回放缓冲区反复使用,样本效率高,Q 学习、DQN、DDPG、TD3、SAC 都属于这一类。代价是数据分布和当前策略不一致,训练更容易不稳定。真机强化学习因为交互昂贵,多选异策略算法。注意:中文「离线策略」常指异策略,但它和「离线强化学习」不是一回事,异策略算法通常仍在一边训练一边采集新数据。
例子SERL 用基于 SAC 的异策略算法 RLPD,每个训练批次一半来自人类演示、一半来自机器人在线采集的回放数据,在 PCB 插装、理线等任务上平均 25 到 50 分钟训出策略。
- 也叫
- 离策略、离轨策略、离线策略、Off-Policy Learning
- 相关
- 同策略、经验回放、软演员-评论家、Q 学习、离线强化学习、SERL
- 来源
- OpenAI Spinning Up: Kinds of RL Algorithms
Wikipedia: State–action–reward–state–action (SARSA vs Q-learning)
SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning