具身智能新手名词表English

后见之明经验回放

Hindsight Experience ReplayHER进阶

把没达成的尝试改标成达成了实际到达的目标,让稀疏奖励也能学起来。

OpenAI 的 Andrychowicz 等人 2017 年提出(NIPS 2017)。在只有成功或失败二值奖励的目标条件任务里,机器人早期几乎从不成功,回放池里全是失败样本,学不到东西。HER 的做法是:把一条失败轨迹再存一份,把目标换成这条轨迹实际到达的状态(比如最终状态,或之后某一时刻的状态),它就变成了一条成功样本。它能接在任何异策略算法(可以用旧数据学习的算法,如 DDPG)后面,效果上相当于自动生成的课程。原论文在 Fetch 机械臂上完成了推、滑、抓取放置任务,并把仿真里训出的策略部署到了真机上。这种事后重标注的思路后来被目标条件模仿学习等方法广泛借用。

例子让机械臂把方块推到红点,结果推到了旁边 10 厘米处;HER 把这条轨迹的目标改写成推到那 10 厘米处,它就成了一条成功经验。

也叫
事后经验回放
相关
稀疏奖励、目标条件强化学习、经验回放、事后重标注、深度确定性策略梯度、异策略
来源
Hindsight Experience Replay (arXiv 1707.01495)

在完整名词表里查看 →