DAgger(数据集聚合)
Dataset AggregationDAgger常用让策略自己去跑,专家为它走到的状态补标正确动作,合并数据后重训。
DAgger 是 Ross、Gordon 和 Bagnell 在 AISTATS 2011 提出的交互式模仿学习算法。它针对行为克隆的复合误差:只在专家轨迹上训练的策略,一偏离就不知所措。做法是多轮迭代:先用专家数据训练初始策略;让当前策略去执行,记录它实际遇到的状态;请专家为这些状态标注「这里该怎么做」;把新标注并入历史数据集,重新训练,如此反复。论文证明这样能把误差随任务长度的增长从二次降到近似线性。缺点是专家要随时标注,真机上常用人在旁监控、必要时接管的 HG-DAgger 等变体。
例子原论文在赛车游戏 Super Tux Kart 里学转向、在 Super Mario Bros. 里学通关,DAgger 的表现都好于只用专家演示做监督学习的方法。
- 也叫
- 数据集聚合、DAGGER
- 相关
- 复合误差、分布偏移(协变量偏移)、行为克隆、人工门控 DAgger、交互式模仿学习、人在回路
- 来源
- A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (PMLR v15)
A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (PDF, 含 DAgger 算法与 T²ε 分析)