具身智能新手名词表English

内在奖励

Intrinsic Motivation (Curiosity-Driven Exploration)进阶

智能体自己给「新奇、预测不准」的状态发奖励,以此驱动探索。

内在奖励指不来自任务本身、由智能体内部计算的奖励信号,常衡量状态有多新奇、或自己预测得有多不准,通常与环境给的外在奖励相加使用。它主要解决稀疏奖励下的探索难题:任务奖励很少出现时,靠随机尝试很难碰到。代表工作有 2017 年 Pathak 等人的 ICM,把「预测自身动作后果的误差」当作好奇心;2018 年 OpenAI 的 RND 用「预测一个固定随机网络输出的误差」作奖励,在 Atari 游戏《蒙特祖玛的复仇》上首次在不用示范的情况下超过人类平均分。机器人领域常把它用于探索和无监督技能发现。

例子ICM 在《超级马里奥》里完全不给游戏得分,只奖励智能体「预测不准下一帧特征」的情况,智能体仍会主动往关卡深处探索。

也叫
好奇心驱动探索、内在动机、内部奖励、Intrinsic Reward
相关
探索与利用、稀疏奖励、无监督技能发现、奖励塑形、强化学习、主动探索
来源
Curiosity-driven Exploration by Self-supervised Prediction (ICM, arXiv:1705.05363)
Exploration by Random Network Distillation (RND, arXiv:1810.12894)

在完整名词表里查看 →