具身智能新手名词表English

对抗运动先验

Adversarial Motion PriorsAMP进阶

用判别器评判动作像不像动捕数据,把「像不像」当奖励来学自然动作。

AMP 由 Xue Bin Peng、Pieter Abbeel、Sergey Levine、Angjoo Kanazawa 等人 2021 年提出,最初用于仿真角色动画。它借鉴生成对抗模仿学习:训练一个判别器,输入相邻两帧状态,判断这段运动来自参考动作数据集还是来自策略;策略把骗过判别器的程度当作风格奖励,与任务奖励(如按指令速度前进)加权相加后用强化学习优化。好处是不必手写模仿目标,也不用挑选要跟踪的动作片段,一堆无结构的动捕片段就能让动作自然。2022 年 Escontrela 等人把它用到 Unitree A1 四足机器人上,只用约 4.5 秒德牧动捕数据就学出了自然且节能的步态,常被用来替代繁琐的奖励工程。

例子Escontrela 等人在 A1 上把风格奖励权重设为 0.65、任务奖励设为 0.35,机器狗学出类似真狗的步态,并能随速度自然切换步态,直接迁移到真机。

也叫
AMP 风格奖励、对抗运动先验奖励
相关
生成对抗模仿学习、奖励工程、DeepMimic、ASE(对抗技能嵌入)、运动跟踪、仿真到现实迁移
来源
AMP: Adversarial Motion Priors for Stylized Physics-Based Character Control (arXiv 2104.02180)
Adversarial Motion Priors Make Good Substitutes for Complex Reward Functions (arXiv 2203.15103)

在完整名词表里查看 →