从观测中模仿学习
Imitation from ObservationIfO进阶只看到示范的状态或视频、没有动作标签,也要学会模仿的一类方法。
普通模仿学习需要观测-动作对;从观测中模仿只拿到示范者的状态序列,比如人做事的视频,不知道每一步具体发了什么控制指令。这样就能用上互联网视频、人类视频等海量资源,但还要处理视角和身体结构不同的问题。代表工作有:2017 年伯克利 Liu 等人用上下文翻译把人类视频转成机器人视角,再做强化学习;2018 年 UT Austin 的 Torabi 等人提出 BCO,先让智能体自己探索、学一个逆动力学模型(由前后两帧推出动作),再给专家视频补上动作标签做行为克隆;此外还有对抗式方法。今天用人类视频预训练、潜在动作、伪动作标签的具身工作,要解决的是同一个问题。
例子Liu 等人 2017 年的论文里,机器人只看人类扫地、舀杏仁、推物体的视频(没有关节记录),学会了用工具完成同样的动作。
- 也叫
- 无动作标签模仿、从视频中模仿、Imitation Learning from Observation
- 相关
- 无动作标签视频、逆动力学模型、人类视频数据、潜在动作、伪动作标签、LAPA
- 来源
- Recent Advances in Imitation Learning from Observation (IJCAI 2019 survey)
Behavioral Cloning from Observation (IJCAI 2018)
Imitation from Observation: Learning to Imitate Behaviors from Raw Video via Context Translation (ICRA 2018)