具身智能新手名词表English

外推误差

Extrapolation Error (OOD Actions in Offline RL)进阶

离线强化学习中,Q 网络给数据里没出现过的动作乱估值而产生的误差。

这一概念由 Fujimoto、Meger、Precup 在 2019 年提出 BCQ 算法的 ICML 论文中系统阐述。离线强化学习只能用固定数据集训练,不能再和环境交互。Q 学习更新时要对下一状态取 max_a Q(s′, a),而网络对数据中没出现过的动作(分布外动作)的估值只是外推,可能严重偏高;策略偏偏去选这些动作,误差经贝尔曼备份不断累积,学出的策略很差。在线训练可以实际试一下来纠正,离线做不到。应对思路主要有:约束策略贴近数据行为(BCQ、策略约束)、压低分布外动作的 Q 值(CQL)、完全不查询分布外动作(IQL)。

例子BCQ 论文中,一个离线的 DDPG 智能体与在线 DDPG 用完全相同的一批数据同时训练,结果在所有任务上都明显落后、价值估计不稳定甚至发散,作者把原因归为外推误差。

也叫
分布外动作问题、OOD 动作高估、Extrapolation Error
相关
离线强化学习、Q 值高估、保守 Q 学习、隐式 Q 学习、策略约束、分布外
来源
Off-Policy Deep Reinforcement Learning without Exploration (BCQ, arXiv:1812.02900)
Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems (arXiv:2005.01643)

在完整名词表里查看 →