互联网视频数据
Internet Video Data常用网上公开的海量视频,量大且便宜,但没有机器人能直接用的动作标签。
互联网视频数据指视频平台和公开视频数据集里的视频,内容多是人做家务、做饭、用工具。和机器人数据相比,它规模大几个数量级,场景和物体极其多样,包含大量关于物体怎么动、任务怎么分步的知识。难点在于没有动作标签:画面里是人手而不是机械臂,也不知道每一帧对应什么关节指令。常见用法有三类:预训练视觉表征(如 R3M);学习潜在动作,即从相邻帧的变化中自动归纳出类似动作的编码(如 LAPA);训练视频生成或世界模型,再从预测画面中反推动作。Ego4D 这类第一人称视频集也常被这样使用。
例子LAPA 先用 VQ-VAE 从无标签视频的相邻帧中学出离散的潜在动作,用它预训练 VLA,再用少量真机数据把潜在动作映射成机器人指令。
- 也叫
- 网络视频数据、网络视频、Web Video Data
- 相关
- 人类视频数据、无动作标签视频、潜在动作、LAPA、第一人称视频、Ego4D 数据集
- 来源
- LAPA: Latent Action Pretraining from Videos (arXiv 2410.11758)
Ego4D 官网