具身智能新手名词表English

AVDC(从无动作视频学动作)

AVDC: Learning to Act from Actionless Videos through Dense CorrespondencesAVDC进阶

先生成「机器人做任务」的视频,再用光流反推该执行的动作,全程不需要动作标签。

AVDC 由台湾大学与 MIT 合作提出(作者含 Yilun Du、Joshua Tenenbaum),发表于 ICLR 2024(Spotlight)。机器人数据贵在动作标签,只有画面的视频却很多。AVDC 给定当前画面和文字指令,先用文本条件的扩散视频生成模型「想象」出完成任务的视频;再估计相邻帧的光流(每个像素往哪动),当作稠密对应关系,结合第一帧深度算出物体的刚体位姿变化,最后换算成机械臂的抓取和移动动作。策略只用 RGB 视频训练,在 Meta-World 操作、iTHOR 导航和真实 Franka 机械臂上验证,还开源了 4 张 GPU 一天即可训练的视频模型框架。它与 UniPi 同属「用视频生成当策略」的路线。

例子只用 198 段人手推物体的视频(不含任何机器人动作)训练视频模型,不做微调直接控制仿真机械臂完成推物任务,40 次试验成功率 90%,这就是从人到机器人的跨本体迁移。

也叫
Actionless Video through Dense Correspondences、Learning to Act from Actionless Videos
相关
无动作标签视频、UniPi、视频生成模型、光流、从观测中模仿学习、人类视频数据
来源
Learning to Act from Actionless Videos through Dense Correspondences (arXiv 2310.08576)
OpenReview: ICLR 2024 spotlight
AVDC 项目页
信息截至
2024-01

在完整名词表里查看 →