内在奖励
Intrinsic Motivation (Curiosity-Driven Exploration)进阶智能体自己给「新奇、预测不准」的状态发奖励,以此驱动探索。
内在奖励指不来自任务本身、由智能体内部计算的奖励信号,常衡量状态有多新奇、或自己预测得有多不准,通常与环境给的外在奖励相加使用。它主要解决稀疏奖励下的探索难题:任务奖励很少出现时,靠随机尝试很难碰到。代表工作有 2017 年 Pathak 等人的 ICM,把「预测自身动作后果的误差」当作好奇心;2018 年 OpenAI 的 RND 用「预测一个固定随机网络输出的误差」作奖励,在 Atari 游戏《蒙特祖玛的复仇》上首次在不用示范的情况下超过人类平均分。机器人领域常把它用于探索和无监督技能发现。
例子ICM 在《超级马里奥》里完全不给游戏得分,只奖励智能体「预测不准下一帧特征」的情况,智能体仍会主动往关卡深处探索。
- 也叫
- 好奇心驱动探索、内在动机、内部奖励、Intrinsic Reward
- 相关
- 探索与利用、稀疏奖励、无监督技能发现、奖励塑形、强化学习、主动探索
- 来源
- Curiosity-driven Exploration by Self-supervised Prediction (ICM, arXiv:1705.05363)
Exploration by Random Network Distillation (RND, arXiv:1810.12894)