具身智能新手名词表English

WebDataset 格式

WebDataset进阶

把训练样本按同名文件打包进一串 tar 分片,方便大规模顺序读取的数据格式。

由 Thomas Breuel 开发的开源深度学习数据格式及同名 Python 库,PyTorch 官方博客曾专文介绍,并与英伟达的 AIStore 存储服务配套。它不发明新格式,而是直接用标准 tar 归档:同一条样本的多个文件(如 000042.jpg、000042.json)去掉扩展名后同名、相邻存放,整个数据集切成编号连续的分片(shard)。训练时按分片顺序读、不用解压,可以直接从本地磁盘、网页服务器或云存储流式读取,适合海量小文件和多 GPU 训练,避免随机读取拖垮文件系统。它实现了 PyTorch 的 IterableDataset 接口,能直接接 DataLoader。具身领域常用它打包大规模视频和图像数据,例如智在无界在 Hugging Face 发布的 UniHand_Preview 就是这种格式。

例子把 100 万段第一人称视频切成 1000 个 tar 分片,每个分片里放「编号.mp4 + 编号.json」,训练时多台机器各读一部分分片并行加载。

也叫
wds
相关
Parquet 格式、HDF5 格式、Zarr 格式、TFRecord 格式、LeRobot 数据集格式、RLDS 格式
来源
webdataset/webdataset (GitHub)
Efficient PyTorch I/O library for Large Datasets, Many Files, Many GPUs (PyTorch Blog)
BeingBeyond/UniHand_Preview (Hugging Face)

在完整名词表里查看 →