Actor-Learner 分离架构
Actor-Learner Architecture (Distributed RL)进阶把「与环境交互采数据」和「更新网络参数」拆给不同进程或机器并行执行。
这是分布式强化学习常用的系统设计:多个 actor(执行者)各持一份策略副本,在各自的环境里交互、产生经验;learner(学习者)集中收集经验、在 GPU 上更新参数,再定期把新参数同步回 actor。DeepMind 2018 年的 Ape-X 和 IMPALA 是代表:Ape-X 让 actor 把经验写入共享的回放缓冲区;IMPALA 让 actor 直接把轨迹发给 learner,并用 V-trace(一种重要性加权修正)处理 actor 策略略微落后带来的偏差。好处是采样与训练互不阻塞,可扩展到上千台机器。真机强化学习同样需要这种拆分:SERL 把 actor 和 learner 放在不同线程,训练再慢也不会拖低机器人的控制频率。
例子SERL 在真机上并行跑三个进程:actor 选动作、learner 训练网络、机器人环境执行动作,从而保持固定的控制频率,也缩短了真实世界训练的总耗时。
- 也叫
- Actor-Learner 架构、执行者-学习者架构、采样与训练解耦
- 相关
- 经验回放、异策略、重要性采样、真机强化学习、SERL、大规模并行强化学习
- 来源
- IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures (arXiv 1802.01561)
Distributed Prioritized Experience Replay (Ape-X, arXiv 1803.00933)
SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning (arXiv 2401.16013)