具身智能新手名词表English

Q 值高估

Overestimation Bias进阶

Q 学习取最大值时把估计噪声一起放大,导致动作价值被系统性高估。

Q 学习的更新目标里有一步:取下一状态所有动作 Q 值中的最大值。Q 值本身是带噪声的估计,对一组有误差的数取最大,结果在期望上会偏高;这个偏差又通过自举一轮轮往回传,让智能体偏爱被高估的动作,策略变差。Thrun 和 Schwartz 1993 年就指出了这一问题。van Hasselt 提出 Double Q-learning,用一组估计选动作、另一组估计评价值,2015 年又与 DeepMind 同事把它做成 Double DQN,证实原版 DQN 在一些 Atari 游戏上高估明显。连续控制中的 TD3 取两个评论家网络的较小值来压制高估,SAC 也沿用这一做法。离线强化学习里,对数据中没出现过的动作的高估更严重,保守 Q 学习等方法专门处理这一点。

例子TD3 同时训练两个评论家网络,计算目标值时取两者中较小的那个(裁剪双 Q 学习),宁可略微低估也不高估,从而让训练更稳定。

也叫
过估计偏差、Q 值过估计、最大化偏差(Maximization Bias)
相关
Q 学习、深度 Q 网络、双延迟深度确定性策略梯度、目标网络、外推误差、保守 Q 学习
来源
van Hasselt, Guez, Silver 2015: Deep Reinforcement Learning with Double Q-learning
Fujimoto et al. 2018: Addressing Function Approximation Error in Actor-Critic Methods (TD3)

在完整名词表里查看 →