具身智能新手名词表English

目标条件策略

Goal-conditioned Policy常用

除了当前观测,还把「要达到的目标」作为输入来决定动作的策略。

目标条件策略是把目标也当作输入的策略,常写作 π(a | s, g):s 是当前状态或观测,g 是目标,可以是一个目标位置、一张目标图像或一个目标状态。普通策略只学一个固定任务,目标条件策略用同一个网络完成「到达不同目标」的一族任务,换目标不用重新训练。在强化学习里这叫目标条件强化学习,常配合后见之明经验回放(HER,把没达成原目标的轨迹按实际到达的位置重新标注成功)缓解稀疏奖励;在模仿学习里,Lynch 等人 2019 年的 Play-LMP 用无任务标签的玩耍数据训练,测试时给出目标就能完成对应动作。目标用一句话描述时,就是语言条件策略。

例子给机械臂一张「积木在桌子左上角」的照片作为目标,策略就把积木往那里推;换一张照片,同一个策略就去完成新目标。

也叫
目标条件化策略
相关
目标条件强化学习、后见之明经验回放、语言条件策略、目标条件模仿学习、事后重标注、策略
来源
Goal-Conditioned Reinforcement Learning: Problems and Solutions (IJCAI 2022 Survey, arXiv 2201.08299)
Hindsight Experience Replay (arXiv 1707.01495)
Learning Latent Plans from Play (arXiv 1903.01973)

在完整名词表里查看 →