REINFORCE 算法
REINFORCE进阶最早的策略梯度算法:按整条轨迹的回报,调高带来高回报的动作的概率。
REINFORCE 由 Ronald Williams 在 1992 年提出,是最早的策略梯度算法。做法是:用当前策略完整跑完若干回合,对每一步动作,用它之后拿到的累计回报去加权该动作对数概率的梯度,回报高的动作被调得更容易出现。因为回报直接来自整条轨迹的采样、而不是价值估计,它也叫蒙特卡洛策略梯度,估计无偏但方差大、样本效率低;减去一个基线(如平均回报或价值函数)能明显降低方差,这一思路后来发展成演员-评论家方法。PPO 也建立在策略梯度之上;大语言模型后训练中的 RLOO、GRPO 用组内平均回报当基线,沿用的也是 REINFORCE 的思路。
例子让机械臂学推方块:每回合推到目标回报记 1,否则记 0。REINFORCE 会调高成功回合里每一步动作的概率,失败回合的梯度为零;加上基线后,低于平均的回合里的动作会被压低。
- 也叫
- 蒙特卡洛策略梯度、Monte Carlo Policy Gradient
- 相关
- 策略梯度、蒙特卡洛方法(蒙特卡洛回报)、回报、优势函数、近端策略优化、组相对策略优化
- 来源
- Wikipedia: Policy gradient method
Ahmadian et al. 2024: Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs