具身智能新手名词表English

双延迟深度确定性策略梯度

Twin Delayed Deep Deterministic Policy GradientTD3常用

在 DDPG 上加三处改进、专门抑制 Q 值高估的连续动作强化学习算法。

TD3 由 Scott Fujimoto、Herke van Hoof、David Meger 在 ICML 2018 提出,是 DDPG(输出确定动作的演员-评论家算法)的改进版,属于异策略算法(可反复利用旧数据),只用于连续动作。DDPG 的 Q 网络容易高估动作价值,策略又会去钻这些高估的空子,训练常不稳定。TD3 用三招应对:同时训练两个 Q 网络,算目标值时取较小者(Twin);Q 网络更新两次才更新一次策略和目标网络(Delayed);给目标动作加截断噪声,让 Q 值随动作变化更平滑。它和 SAC 是连续控制最常用的两个基线,离线强化学习方法 TD3+BC 也以它为底座。

例子原论文在 OpenAI Gym 的 MuJoCo 连续控制任务(如 HalfCheetah、Hopper、Walker2d)上测试,TD3 的表现超过了 DDPG 等当时的主流算法。

也叫
TD3 算法、Twin Delayed DDPG
相关
深度确定性策略梯度、Q 值高估、目标网络、软演员-评论家、异策略、价值函数
来源
Addressing Function Approximation Error in Actor-Critic Methods (TD3, arXiv 1802.09477)
OpenAI Spinning Up: Twin Delayed DDPG
A Minimalist Approach to Offline Reinforcement Learning (TD3+BC, arXiv 2106.06860)

在完整名词表里查看 →