具身智能新手名词表English

策略梯度

Policy GradientPG常用

直接求期望回报对策略参数的梯度,沿梯度方向改进策略的方法。

强化学习里直接优化策略的一大类方法。策略用带参数的网络表示,目标是最大化期望回报;策略梯度给出这个目标对参数的梯度:把每一步动作的对数概率梯度乘上它带来的回报,于是回报高的动作概率被调高、回报低的被调低,用采样轨迹就能估计。Williams 1992 年的 REINFORCE 是早期代表,Sutton 等人 1999 年给出了配合函数逼近使用的策略梯度定理。实际中常减去一个基线,用优势函数(这个动作比平均水平好多少)代替原始回报来降低方差,由此发展出演员-评论家、TRPO、PPO。它天然支持连续动作,适合机器人控制,但通常是同策略的,样本效率不高。

例子训练机械臂推箱子:先用当前策略采样一批轨迹,把箱子推到目标的轨迹里做过的动作概率调高,失败轨迹里的调低,反复迭代,策略逐渐变好。

也叫
策略梯度方法、Policy Gradient Methods
相关
REINFORCE 算法、优势函数、近端策略优化、信赖域策略优化、同策略、广义优势估计
来源
OpenAI Spinning Up: Intro to Policy Optimization
Policy Gradient Methods for Reinforcement Learning with Function Approximation (Sutton et al., NIPS 1999)

在完整名词表里查看 →