具身智能新手名词表English

Ego-Exo4D 数据集

Ego-Exo4D进阶

Meta 牵头的第一人称与第三视角同步拍摄的大规模技能活动视频数据集。

Meta FAIR 牵头、联合全球十多所高校于 2023 年发布的多视角视频数据集,约 1286 小时,740 名参与者,分布在 13 座城市。录制时参与者戴 Aria 眼镜拍第一人称画面,周围再架 4–5 台 GoPro 拍第三视角,内容是做饭、修自行车、跳舞、攀岩等 8 类技能活动,并附视线、IMU(惯性测量单元)、3D 点云、相机位姿和专家讲解文字。它用来研究同一个动作在自己眼里和旁人眼里分别是什么样。对具身智能来说,机器人头部和腕部相机看到的接近第一人称画面,而网上的教学视频多是第三视角,这套数据可用来学两种视角的对应,以及手部和人体 3D 姿态估计。

例子同一段「修自行车」被 Aria 眼镜和 4 台 GoPro 同时拍下,研究者可以训练模型把第三视角画面转换成第一人称视角(论文中的跨视角转换基准)。

相关
第一人称视频、第三视角视频、Ego4D 数据集、Project Aria 眼镜、人类视频数据、手部姿态估计
来源
Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives (arXiv)
Ego-Exo4D 官网
信息截至
2024-09

在完整名词表里查看 →