具身智能新手名词表English

从观测中模仿学习

Imitation from ObservationIfO进阶

只看到示范的状态或视频、没有动作标签,也要学会模仿的一类方法。

普通模仿学习需要观测-动作对;从观测中模仿只拿到示范者的状态序列,比如人做事的视频,不知道每一步具体发了什么控制指令。这样就能用上互联网视频、人类视频等海量资源,但还要处理视角和身体结构不同的问题。代表工作有:2017 年伯克利 Liu 等人用上下文翻译把人类视频转成机器人视角,再做强化学习;2018 年 UT Austin 的 Torabi 等人提出 BCO,先让智能体自己探索、学一个逆动力学模型(由前后两帧推出动作),再给专家视频补上动作标签做行为克隆;此外还有对抗式方法。今天用人类视频预训练、潜在动作、伪动作标签的具身工作,要解决的是同一个问题。

例子Liu 等人 2017 年的论文里,机器人只看人类扫地、舀杏仁、推物体的视频(没有关节记录),学会了用工具完成同样的动作。

也叫
无动作标签模仿、从视频中模仿、Imitation Learning from Observation
相关
无动作标签视频、逆动力学模型、人类视频数据、潜在动作、伪动作标签、LAPA
来源
Recent Advances in Imitation Learning from Observation (IJCAI 2019 survey)
Behavioral Cloning from Observation (IJCAI 2018)
Imitation from Observation: Learning to Imitate Behaviors from Raw Video via Context Translation (ICRA 2018)

在完整名词表里查看 →