目标条件模仿学习
Goal-Conditioned Behavior CloningGCBC进阶把要达成的目标和当前观测一起输入策略的行为克隆。
在普通行为克隆(用监督学习照抄示范动作)的基础上,给策略多加一个输入:目标,通常是一张目标图像或目标状态,也可以换成语言。训练数据常靠事后重标注得到:从一段示范里截一个片段,把片段最后一帧当作目标,前面的动作就是到达这个目标的示范,所以没有任务标签的玩耍数据也能用。2019 年谷歌 Lynch 等人的 Learning from Play 论文把它作为基线 Play-GCBC;同年的 GCSL 让智能体自己采数据、反复重标注后再做监督学习。它结构简单,是很多目标条件、语言条件策略的起点,短板是同一个目标有多种走法时(动作多峰性)容易学成平均动作。
例子从一段遥操作玩耍数据里随机截一小段,以末帧图像为目标,训练一个看到当前画面和目标画面就输出动作的策略。
- 也叫
- 目标条件行为克隆、Goal-Conditioned Imitation Learning
- 相关
- 行为克隆、目标条件策略、事后重标注、玩耍数据、目标条件强化学习、动作多峰性
- 来源
- Learning Latent Plans from Play(项目页,含 Play-GCBC 基线)
Learning to Reach Goals via Iterated Supervised Learning (GCSL, arXiv 1912.06088)