信赖域策略优化
Trust Region Policy OptimizationTRPO进阶每次更新都限制新旧策略差异(KL 散度)的策略梯度算法,PPO 的前身。
信赖域策略优化由 Schulman、Levine、Abbeel 等人在 ICML 2015 提出。普通策略梯度沿梯度走一步,步子稍大就可能让性能骤降,而且参数上的小改动也可能让动作分布变很多。TRPO 把约束放在策略分布上:在新旧策略平均 KL 散度不超过阈值的「信赖域」内最大化替代目标,理论上可保证单调改进。实现上用共轭梯度求近似二阶的更新方向,再用回溯线搜索检查约束和改进。它是同策略算法,实现较繁琐;2017 年同一作者提出的 PPO 用更简单的方式近似这个约束,已成为机器人强化学习主流。
例子OpenAI Spinning Up 的 TRPO 实现中,每轮先用共轭梯度算出更新方向,再按回溯系数不断缩短步长,直到新策略既不超过 KL 上限、又让替代目标变好。
- 也叫
- 信任域策略优化、置信域策略优化
- 相关
- 近端策略优化、策略梯度、KL 散度、同策略、广义优势估计、强化学习
- 来源
- Schulman et al. 2015: Trust Region Policy Optimization (ICML 2015)
OpenAI Spinning Up: Trust Region Policy Optimization
Schulman et al. 2017: Proximal Policy Optimization Algorithms