模仿学习
Imitation LearningIL入门必知让机器人通过模仿专家(通常是人)的示范动作来学会技能。
模仿学习研究如何让智能体从专家演示中学会行为,适合「演示一遍比写规则或设计奖励更容易」的场景。演示通常由人通过遥操作、拖动示教或动作捕捉记录下来。主要路线有三类:行为克隆,直接用监督学习拟合演示动作;逆强化学习,先从演示反推奖励函数,再用强化学习优化;对抗式模仿如 GAIL,让策略的行为分布逼近专家。核心难题是分布偏移:执行时策略会走到演示没覆盖的状态,DAgger 等方法会在这些状态上请专家补标。当前主流 VLA 的主干训练本质上都是大规模模仿学习。
例子Mobile ALOHA 每个任务只采 50 条人类遥操作演示,并与已有的静态 ALOHA 数据协同训练,学会了炒虾装盘、按电梯进电梯、打开壁柜放锅等移动操作任务。
- 也叫
- 示教学习、从演示中学习、Learning from Demonstration、LfD、Programming by Demonstration
- 相关
- 行为克隆、逆强化学习、生成对抗模仿学习、DAgger(数据集聚合)、演示数据、遥操作
- 来源
- Osa et al. 2018: An Algorithmic Perspective on Imitation Learning
Wikipedia: Imitation learning
Fu et al. 2024: Mobile ALOHA