具身智能新手名词表English

近端策略优化

Proximal Policy OptimizationPPO入门必知

OpenAI 2017 年提出的强化学习算法,限制每次策略更新幅度,稳定好用。

PPO 由 OpenAI 的 Schulman 等人在 2017 年提出,属于策略梯度方法(直接调整策略网络,让带来高回报的动作更常被选中),而且是同策略(on-policy)的:只用当前策略自己刚采的数据来更新。核心是带「裁剪」的目标函数:新策略把某个动作的概率相对旧策略改得超出一定范围后,目标函数不再因此变大,既不会一步把策略改坏,同一批数据也能反复训练多轮。它和 TRPO(信赖域策略优化)一样稳定,但实现简单得多。PPO 是仿真中训练足式、人形机器人运控的主力算法,ETH 开源的机器人强化学习库 rsl_rl 就以它为核心;InstructGPT 的 RLHF 也用了 PPO。

例子ETH 的 Rudin 等人在 legged_gym 中用 PPO、在单块 GPU 上并行跑数千个仿真环境训练 ANYmal 四足,平地行走不到 4 分钟、崎岖地形约 20 分钟就能训出策略,并迁移到真机。

也叫
PPO-Clip、PPO 算法
相关
强化学习、策略梯度、信赖域策略优化、同策略、广义优势估计、rsl_rl
来源
Schulman et al. 2017: Proximal Policy Optimization Algorithms
OpenAI Spinning Up: Proximal Policy Optimization
Rudin et al. 2021: Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning

在完整名词表里查看 →