因果混淆
Causal Confusion (Causal Misidentification)进阶模仿学习把和专家动作相关、但不是原因的线索当成依据,部署时出错。
因果混淆由 de Haan、Jayaraman、Levine 在 NeurIPS 2019 论文中系统提出。行为克隆把模仿当成监督学习,看观测直接回归专家动作,只学相关性,不区分谁是因、谁是果;如果训练数据里某个线索和专家动作高度相关,模型就会依赖它。训练时这类线索一直在,损失很低;部署时策略自己走出的状态和专家不同(分布偏移),线索不再可靠,策略就出错。反直觉的症状是:给模型更多输入信息,表现反而更差,输入里带历史信息时尤其常见。论文提出用有针对性的干预,即在环境里试执行或询问专家,来找出正确的因果结构,效果优于 DAgger 等基线。它提醒我们,机器人策略的输入不是越多越好。
例子论文里的驾驶例子:模型 A 看完整画面(含仪表盘),模型 B 的仪表盘被遮住。两者训练损失都很低,上路后 B 开得好、A 不行,因为仪表盘上有踩刹车就会亮的指示灯,A 学成了「灯亮才刹车」,把刹车的结果当成了原因。
- 也叫
- 捷径学习(模仿学习中)、因果误识别、Causal Misidentification
- 相关
- 行为克隆、模仿学习、分布偏移(协变量偏移)、复合误差、DAgger(数据集聚合)、过拟合
- 来源
- Causal Confusion in Imitation Learning (arXiv 1905.11979)