目标网络
Target Network进阶主网络的一个慢更新副本,专门用来算训练目标,让 Q 学习更稳定。
在 Q 学习这类时序差分方法里,训练目标是「即时奖励 + 折扣后的下一状态 Q 值」,而这个 Q 值由正在训练的同一个网络算出,相当于边追目标边挪目标,用神经网络时容易发散。DeepMind 2015 年发表在 Nature 上的 DQN 引入目标网络:复制一份主网络专门算目标,每隔固定步数才同步一次。DDPG、TD3、SAC 等连续控制算法改用软更新,每步让目标网络参数向主网络靠近一点(Polyak 平均,系数接近 1)。它和经验回放一起是离策略深度强化学习的标准组件;TD3 论文还分析了它与 Q 值高估的关系。
例子OpenAI Spinning Up 的 DDPG 文档中,目标网络每次按 φ_targ ← ρ·φ_targ + (1−ρ)·φ 软更新,ρ 举例取 0.995;而 DQN 类算法是每隔固定步数把主网络整体复制过去。
- 也叫
- 目标 Q 网络、Target Q-Network
- 相关
- 深度 Q 网络、Q 函数、时序差分学习、经验回放、Q 值高估、软演员-评论家
- 来源
- OpenAI Spinning Up: Deep Deterministic Policy Gradient(Target Networks 一节)
Wikipedia: Q-learning(Deep Q-learning 一节)
Fujimoto et al. 2018: Addressing Function Approximation Error in Actor-Critic Methods (TD3)