具身智能新手名词表English

生成对抗模仿学习

Generative Adversarial Imitation LearningGAIL进阶

用判别器区分专家动作和策略动作,逼着策略学得像专家的模仿学习方法。

斯坦福的 Jonathan Ho 和 Stefano Ermon 在 2016 年提出。传统路线是先用逆强化学习(从示范反推奖励函数)恢复专家的奖励,再用强化学习训策略,两步走又慢又绕。GAIL 借用生成对抗网络的结构:判别器负责分辨一个状态-动作对来自专家示范还是来自当前策略,策略把判别器的输出当作奖励,用 TRPO(一种限制每步更新幅度的策略梯度算法)更新,直到判别器分不出来。它要和环境反复交互,所以多在仿真里用,但比行为克隆更不容易出现复合误差(小错越积越大)。人形机器人和角色动画里常用的对抗运动先验(AMP)就是沿着这种对抗式模仿的思路发展出来的。

例子原论文在 MuJoCo 仿真的人形行走等任务上,只给几条专家轨迹、不给奖励函数,GAIL 训出的策略大多能达到专家表现的七成以上。

相关
逆强化学习、模仿学习、行为克隆、生成对抗网络、对抗运动先验、信赖域策略优化
来源
Generative Adversarial Imitation Learning (Ho & Ermon, arXiv 1606.03476)

在完整名词表里查看 →