09数据与采集
学习的原料:演示数据怎么采、有哪些数据集、数据怎么处理和规模化。 · 177 条
- 9.1数据的基本单位与来源13
- 9.2用真机采:遥操作与示教22
- 9.3不用真机:手持与穿戴采集13
- 9.4动作捕捉与人形动作数据14
- 9.5人类视频与第一人称数据27
- 9.6仿真资产与合成数据24
- 9.7主流真机数据集22
- 9.8数据格式与工具9
- 9.9清洗、标注与配比21
- 9.10规模化:数采厂到数据飞轮12
9.1数据的基本单位与来源
先认识一条演示数据由观测和动作组成,再看真机、仿真、人类视频几大来源。
- 演示数据Demonstration Data人示范完成任务时录下的观测与动作序列,供机器人模仿学习。
- 观测-动作对Observation-Action Pair某一时刻机器人「看到了什么」和「接着做了什么」配成的一条训练样本。
- 动作标签Action Label数据里每一时刻机器人执行的动作值,是模仿学习要拟合的「答案」。
- 多模态数据Multimodal Data同一时刻同步记录的图像、深度、关节状态、力触觉、语言等多路信号。
- 触觉数据Tactile Data触觉传感器在接触物体时记下的压力、剪切力、接触面形变等信号。
- 多传感器时间同步(时间戳对齐)Multi-sensor Time Synchronization / Timestamp Alignment让相机、编码器、IMU 等各路信号对齐到同一时间轴,保证同一时刻的数据配成对。
- 真机数据Real-Robot Data用真实机器人在物理世界里实际操作时采到的数据。
- 数据荒Data Scarcity机器人能用的真实交互数据远少于所需,是具身智能的核心瓶颈。
- 仿真数据Simulation Data在物理仿真器里让虚拟机器人执行任务而自动生成的训练数据。
- 合成数据Synthetic Data不靠真实采集、用仿真或生成模型造出来的训练数据。
- 人类视频数据Human Video Data拍人做事的视频,不用机器人就能采,用来教机器人理解和模仿操作。
- 互联网图文数据Web-scale Vision-Language Data从网上收集的海量图片-文字配对及图文问答数据,让模型认识大千世界。
- 数据金字塔Data Pyramid按数量多少和贴近真机程度,把机器人训练数据分成三层的框架。
9.2用真机采:遥操作与示教
从几大来源里最可靠的真机数据学起:人推着、扳着或远程操控机器人把过程录下。
- 遥操作Teleoperation人通过主臂、VR 等设备实时操控机器人;具身智能里主要用它采演示数据。
- 拖动示教Kinesthetic Teaching人直接用手推着机械臂走一遍动作,机器人记下轨迹用来学习或回放。
- 主从臂遥操作Leader-Follower Teleoperation人扳动一台主臂,机器人从臂实时复制它每个关节的角度。
- GELLOGELLO: A General, Low-Cost, and Intuitive Teleoperation Framework for Robot Manipulators伯克利开源的低成本主从臂遥操作装置,用缩小版复刻臂操控真机。
- 双边遥操作Bilateral Teleoperation主从两端双向传位置和力,操作者能感到机器人碰到了什么的遥操作。
- 外骨骼遥操作Exoskeleton Teleoperation人穿戴与机器人关节对应的外骨骼,用自己手臂的动作直接控制机器人。
- AirExo 外骨骼AirExo上海交大卢策吾团队的低成本双臂外骨骼,可遥操作机器人,也能脱离机器人采数据。
- 3D 鼠标遥操作SpaceMouse Teleoperation用 3D 鼠标的推、拉、扭、倾来控制机械臂末端的六自由度运动。
- VR 遥操作VR Teleoperation戴 VR/XR 头显,用手部追踪或手柄实时操控机器人。
- 苹果的头戴显示设备,具身领域常用它的手部追踪做遥操作和采人类数据。
- 数据手套Data Glove戴在手上、实时记录每根手指弯曲和手部姿态的传感手套。
- 力反馈手套Haptic Glove (Force-Feedback Glove)既采集手部动作、又把受力「推回」操作员手指的遥操作手套。
- 触觉手套Tactile Glove手指和掌心布满压力或触觉传感器,记录人手接触力的手套。
- 动作重定向Motion Retargeting把人(或另一台机器人)的动作换算成目标机器人自己的关节动作。
- AnyTeleopAnyTeleop: A General Vision-Based Dexterous Robot Arm-Hand Teleoperation System用普通相机捕捉人手动作,就能遥操作多种机械臂和灵巧手的通用视觉遥操作系统。
- dex-retargetingdex-retargeting (AnyTeleop hand retargeting library)把人手关键点姿态换算成各种机器人灵巧手关节角的开源工具库。
- Open-TeleVisionOpen-TeleVision: Teleoperation with Immersive Active Visual Feedback戴 VR 头显、以机器人视角立体观察来遥操作人形机器人的开源系统
- 宇树 xr_teleoperate(XR 遥操作)Unitree xr_teleoperate宇树开源的 XR 头显遥操作程序,用来操控宇树人形机器人并录制训练数据。
- 用 Vision Pro 实时遥操作双臂双灵巧手、带振动触觉反馈的采集系统。
- XRoboToolkitXRoboToolkit: A Cross-Platform Framework for Robot TeleoperationPICO 团队开源的跨平台 XR 遥操作框架,用头显和手柄操控各类机器人采数据。
- Isaac Teleop 遥操作框架NVIDIA Isaac Teleop英伟达开源的遥操作与数据采集框架,统一接入 XR 头显、手套等设备。
- 全身遥操作Whole-Body Teleoperation一名操作员同时控制机器人的手臂、躯干、腿或底盘等全身动作。
9.3不用真机:手持与穿戴采集
遥操作离不开真机、又贵又慢,于是改让人拿仿机器人夹爪或戴设备直接干活。
- 无本体采集Robot-free (Embodiment-free) Data Collection采数据时不用真机器人,由人手持或穿戴仿机器人末端的装置直接演示。
- 手持夹爪采集Handheld Gripper Data Collection人手拿着装了相机的夹爪直接干活,录下画面和夹爪轨迹当机器人训练数据。
- 通用操作接口Universal Manipulation Interface拿手持夹爪录演示、不用真机也能训练可部署策略的采集方案。
- UMI on LegsUMI on Legs: Making Manipulation Policies Mobile with Manipulation-Centric Whole-body Controllers用手持夹爪采的人类演示训练操作策略,再搬到带机械臂的四足机器狗上执行。
- FastUMIFastUMI: A Scalable and Hardware-Independent Universal Manipulation Interface上海 AI 实验室等改进 UMI 的手持夹爪采集系统及配套数据集。
- 松灵 Pika 采集套件AgileX Pika松灵机器人的手持式具身数据采集套件,人拿着它干活就能录下操作数据。
- 可穿戴采集Wearable Data Collection让人戴上相机、手套等设备照常干活,把人的动作录成机器人训练数据。
- DexCapDexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation斯坦福的穿戴式手部动捕系统,用人手采数据教机器人灵巧手。
- DexWildDexWild: Dexterous Human Interactions for In-the-Wild Robot PoliciesCMU 的便携手部采集系统,让普通人在各种真实场景用手采灵巧操作数据。
- 采执同构Collection-Execution Isomorphism采集设备与机器人执行末端结构一致,采到的数据可直接用在同构机器人上。
- 技能采集手套Skill Capture Glove (Sunday Robotics)Sunday Robotics 让人戴着做家务、直接产出机器人训练数据的手套。
- DexUMIDexUMI: Using Human Hand as the Universal Manipulation Interface for Dexterous Manipulation用可穿戴外骨骼让人手直接采灵巧手数据,并把画面里的人手换成机器人手。
- DEXOP 数据采集装置DEXOP: A Device for Robotic Transfer of Dexterous Human ManipulationMIT 的被动手部外骨骼,人手直接带动机器人手采集视觉和触觉数据。
9.4动作捕捉与人形动作数据
从手扩展到全身:用动捕录下人的整套动作,再换算成人形机器人能跟的轨迹。
- 动作捕捉Motion Capture用相机或穿戴传感器把人或物体的运动精确记录成数字数据。
- 光学动捕Optical Motion Capture用多台红外相机追踪身上的标记点,三角测量出三维动作
- 惯性动捕Inertial Motion Capture在身上绑一组 IMU 测各部位转动,算出全身姿态的动作捕捉方式。
- 视频动捕(无标记动捕)Markerless / Video-based Motion Capture不贴标记点、不穿动捕服,直接从普通视频里估计人体三维动作。
- BVH / FBX 动捕文件格式BVH / FBX Motion Capture File Formats存人体骨架结构和逐帧关节旋转的两种常见动作捕捉文件格式。
- AMASS 人体动捕数据集AMASS (Archive of Motion Capture as Surface Shapes)把 15 个光学动捕数据集统一成 SMPL 人体模型格式的大型人体动作库。
- LAFAN1 动捕数据集LAFAN1 (Ubisoft La Forge Animation Dataset)育碧 La Forge 公开的人体动捕数据集,常作人形机器人模仿动作的来源。
- HumanML3D 数据集HumanML3D (Text-annotated 3D Human Motion Dataset)给 1.4 万段 3D 人体动作配上 4.5 万句文字描述的文本-动作数据集。
- OMOMO 人-物交互动作数据集OMOMO (Object Motion Guided Human Motion Synthesis) Dataset斯坦福用光学动捕录制的约 10 小时全身搬动日常物体动作数据
- 脚滑 / 漂浮 / 穿地(动作数据伪影)Foot Skating / Floating / Penetration (Motion Data Artifacts)人体动作重定向到机器人后常见的三种违反物理的脚部错误。
- GMR 通用动作重定向General Motion Retargeting斯坦福开源的把人体动作实时映射到多款人形机器人的重定向工具。
- OmniRetargetOmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction把人与物体、地形的交互关系一起重定向到人形机器人的数据生成方法
- Humanoid-X 数据集Humanoid-X (Learning from Massive Human Videos for Universal Humanoid Pose Control, UH-1)从海量网络人类视频提取、配文字描述的人形机器人动作数据集。
- PHUMA 人形动作数据集PHUMA: Physically Reliable Humanoid Locomotion Dataset经物理约束筛选和重定向的大规模人形机器人运动参考数据集
9.5人类视频与第一人称数据
再退一步只拍人干活:视频量最大最便宜,难点是缺动作标签、人手不像机器人。
- 第一人称视频Egocentric Video用头戴或眼镜式相机从本人视角拍的视频,能看清自己的双手。
- 第三视角视频Exocentric Video相机放在执行者身体之外、从旁观角度拍摄人或机器人的视频。
- 互联网视频数据Internet Video Data网上公开的海量视频,量大且便宜,但没有机器人能直接用的动作标签。
- 无动作标签视频Action-free Video只有画面、没有逐帧动作记录的视频,比如人类视频和网络视频。
- 伪动作标签Pseudo Action Labels用模型从视频里反推出来、代替真实记录的动作标签。
- 人类视频机器人化(人→机视频转换)Robotizing Human Videos / Human-to-Robot Video Translation把人手干活的视频改成「机器人在干」的画面,变成可用来训练的机器人数据。
- 跨本体图像替换Cross-Painting (Robot Embodiment Visual Swap)把画面里的新机器人抠掉、换成训练时那台机器人,让视觉策略直接迁移。
- Something-Something V2 数据集Something-Something V2约 22 万段人手摆弄日常物品的短视频,按 174 种动作模板标注。
- EPIC-KITCHENS 数据集EPIC-KITCHENS头戴相机拍摄真实厨房日常操作的经典第一人称视频数据集。
- Ego4D 数据集Ego4DMeta 与 13 所高校合作采集、约 3670 小时的第一人称日常视频数据集。
- Ego-Exo4D 数据集Ego-Exo4DMeta 牵头的第一人称与第三视角同步拍摄的大规模技能活动视频数据集。
- Project Aria 眼镜Project Aria GlassesMeta 做的科研用第一人称数据采集眼镜,只采集、不显示。
- Nymeria 数据集Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the WildMeta 用 Aria 眼镜加动捕服录制的大规模第一人称日常动作数据集
- DexYCB 数据集DexYCB: A Benchmark for Capturing Hand Grasping of Objects英伟达发布的人手抓物体多视角数据集,带手和物体的三维位姿标注。
- HOI4D 数据集HOI4D: A 4D Egocentric Dataset for Category-Level Human-Object Interaction清华等发布的第一人称 4D 手物交互数据集,含 240 万帧 RGB-D。
- OakInk 数据集OakInk上海交大发布的手-物交互数据集,标注物体用途和双手操作过程
- ARCTIC 数据集ARCTIC: A Dataset for Dexterous Bimanual Hand-Object Manipulation人类双手灵巧操作铰接物体的动捕数据集,每帧带精确的手和物体 3D 网格。
- HOT3D 数据集HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View VideosMeta 用 Aria 眼镜和 Quest 3 录制、带动捕真值的第一人称手物交互数据集。
- EgoMimicEgoMimic: Scaling Imitation Learning via Egocentric Video用 Aria 眼镜采人手数据、与机器人数据联合训练同一个策略的框架。
- PH2D 数据集(HAT)PH2D (Physical Human-Humanoid Data) / Humanoid Policy ~ Human Policy用 VR 头显采集的人类第一人称操作数据,和人形机器人数据一起训练策略
- EgoDex 数据集EgoDex苹果用 Vision Pro 采集、带双手 3D 关节标注的第一人称操作视频数据集。
- UniHand 数据集UniHand智在无界把各类人手视频统一成手部动作标注,用来预训练灵巧手 VLA 的数据集。
- Figure Project Go-BigProject Go-BigFigure 用大规模人类第一视角视频给人形机器人做预训练的数据计划。
- 它石 WIYH 数据集World In Your Hands (TARS Robotics)它石智航开源的千小时级真实场景人手操作数据集,含视觉、语言、触觉和动作。
- Egocentric-10K 数据集Egocentric-10KBuild AI 开源的万小时工厂工人第一人称视频数据集。
- Xperience-10M 数据集Xperience-10M (Ropedia)Ropedia 发布的 1 万小时第一人称多模态人类经验数据集,面向具身智能。
- EgoVerse 数据集EgoVerse高校和企业共建、持续扩充的机器人学习用第一人称人类演示数据平台。
9.6仿真资产与合成数据
不再靠人一条条采:备好物体和场景资产,在仿真里批量生成演示或用生成模型造。
- YCB 物体集YCB Object and Model Set一套能买到实物的标准日常物品加 3D 扫描模型,供抓取和操作研究统一对比。
- Google Scanned Objects(GSO)Google Scanned Objects: A High-Quality Dataset of 3D Scanned Household Items谷歌开源的 1030 个真实家居物品高精度 3D 扫描模型库。
- ShapeNet 3D 模型库ShapeNet按 WordNet 类别整理、带语义标注的大规模 3D 物体网格模型库。
- Objaverse 3D 资产库Objaverse艾伦人工智能研究所牵头的超大规模开放 3D 物体模型库
- PartNet-Mobility 数据集PartNet-Mobility带关节运动标注、可直接加载进仿真器的铰接物体 3D 模型库
- ObjectFolder 多感官物体数据集ObjectFolder (1.0 / 2.0 / Real) Multisensory Object Dataset同时提供物体外观、敲击声音和触觉读数的多感官物体数据集
- COCO / LVIS 数据集COCO / LVIS (Common Objects in Context / Large Vocabulary Instance Segmentation)最常用的检测与分割基准,LVIS 在 COCO 图片上扩展到上千个长尾类别。
- ScanNet 数据集ScanNet大规模室内 RGB-D 扫描数据集,带三维重建和语义标注。
- Matterport3D 数据集Matterport3D90 栋真实建筑的室内 RGB-D 扫描数据集,是室内导航研究的常用场景库。
- HM3D 数据集Habitat-Matterport 3D DatasetMeta 与 Matterport 发布的 1000 栋真实建筑室内三维重建,用于导航训练。
- GraspNet-1Billion 数据集GraspNet-1Billion上海交大发布的真实杂乱场景抓取数据集,含超 11 亿个抓取位姿标注。
- ACRONYM 抓取数据集ACRONYM: A Large-Scale Grasp Dataset Based on Simulation英伟达用物理仿真批量标注的平行夹爪抓取数据集,约 1774 万个抓取。
- DexGraspNet 数据集DexGraspNet: A Large-Scale Robotic Dexterous Grasp Dataset for General Objects Based on Simulation北大发布的仿真合成灵巧手抓取数据集,含 5355 个物体上的 132 万个抓取。
- 脚本化演示Scripted Demonstrations用手写的规则程序而不是人来操控机器人,自动生成的示范数据。
- 把少量人类演示按物体切段、变换位姿再拼接,自动生成大量新演示的系统。
- DexMimicGenDexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning英伟达的自动数据生成系统,把几十条演示扩增成上万条双臂灵巧手数据。
- DemoGenDemoGen: Synthetic Demonstration Generation for Data-Efficient Visuomotor Policy Learning把 1 条真机演示自动改编成物体在新位置下的大量合成演示。
- RoboGenRoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation让大模型自动出题、搭仿真场景并学会技能的生成式仿真框架。
- NVIDIA 物理 AI 数据集NVIDIA Physical AI Dataset英伟达在 Hugging Face 上开放的机器人与自动驾驶数据集合集。
- SynGrasp-1B 数据集SynGrasp-1B银河通用等构建的十亿帧仿真合成抓取数据集,用于预训练 GraspVLA。
- InternData-A1 数据集InternData-A1上海 AI 实验室发布的大规模仿真合成数据集,用于预训练通用机器人策略。
- 生成式数据增强Generative Data Augmentation用图像或视频生成模型改写已有机器人数据,多造出新场景的训练样本。
- 神经轨迹Neural Trajectories用视频世界模型生成、再补上伪动作标签的合成机器人训练数据。
- Real2Render2Real(R2R2R)Real2Render2Real: Scaling Robot Data Without Dynamics Simulation or Robot Hardware用手机扫描加一段人手演示视频,渲染出大量机器人训练数据的方法。
9.7主流真机数据集
回到真机看公开数据集:先看汇总多种机器人的 OXE,再按时间看各家代表。
- 跨本体数据Cross-Embodiment Data由多种不同机器人采集、合在一起训练的数据。
- Open X-Embodiment 数据集Open X-Embodiment谷歌牵头汇总 22 种机器人、100 多万条真机轨迹的开源数据集。
- 异构数据Heterogeneous Data来自不同机器人、传感器、采集方式,格式和含义都不统一的数据。
- RoboNet 数据集RoboNet: Large-Scale Multi-Robot Learning2019 年发布的多机器人交互视频数据集,7 种机器人约 1500 万帧。
- BC-Z 数据集BC-Z谷歌 2021 年采的 100 个任务真机演示数据集,用来研究零样本任务泛化。
- Language-Table 数据集Language-Table谷歌发布的桌面推积木数据集,含近 60 万条带自然语言指令的轨迹。
- RT-1 数据集RT-1 Robot Action Dataset (Fractal)谷歌用 13 台机器人历时 17 个月采集的真机操作数据集。
- RH20T 数据集RH20T上海交大发布的多模态真机操作数据集,含力觉、音频和人类示范视频。
- BridgeData V2 数据集BridgeData V2伯克利团队在低成本 WidowX 机械臂上采集的约 6 万条多任务操作数据集。
- RoboSet 数据集RoboSetCMU 与 Meta 发布的厨房场景真机多任务数据集,每帧 4 个视角。
- DROID 数据集DROID (Distributed Robot Interaction Dataset)50 名采集员在三大洲 564 个场景用 Franka 机械臂采集的真机操作数据集。
- ARIO 数据集All Robots In One鹏城实验室等提出的统一具身数据格式标准,及按此标准汇集的约 300 万条数据。
- RoboMIND 数据集RoboMIND (Multi-embodiment Intelligence Normative Data for Robot Manipulation)北京人形机器人创新中心与北大发布的统一规范采集的多本体真机操作数据集。
- AgiBot World 数据集AgiBot World智元机器人等发布的大规模真机操作数据集,Beta 版超百万条轨迹。
- 傅利叶 ActionNet 数据集Fourier ActionNet傅利叶开源的人形机器人加灵巧手遥操作数据集,约 3 万条轨迹。
- 星海图开放世界数据集Galaxea Open-World Dataset星海图用同一款移动双臂机器人在真实场所采集的约 500 小时数据集。
- Humanoid Everyday 数据集Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation南加大与丰田研究院发布的人形机器人真机操作数据集,覆盖 260 个任务。
- RoboCOIN 数据集RoboCOIN: An Open-Sourced Bimanual Robotic Data Collection for Integrated Manipulation智源牵头开源的多本体双臂操作数据集,覆盖 15 种机器人。
- BimanualYAM 数据集MolmoAct2-BimanualYAM DatasetAi2 为 MolmoAct2 采集开源的双臂遥操作数据集,超过 720 小时。
- RoboVQA 数据集RoboVQA: Multimodal Long-Horizon Reasoning for Robotics谷歌 DeepMind 发布的面向机器人长程任务的视频问答数据集。
- 白虎-VTouch 视触觉数据集Baihu-VTouch Visuo-Tactile Dataset国地共建人形机器人创新中心与纬钛科技 2026 年发布的跨本体视触觉数据集。
- 戴盟 Daimon-Infinity 数据集Daimon-Infinity戴盟机器人 2026 年发布的含视触觉信号的大规模真实操作数据集。
9.8数据格式与工具
上节数据集存成什么文件、用什么库读:从 HDF5、RLDS 到 LeRobot。
- HDF5 格式Hierarchical Data Format version 5把多组大数组分层存进一个文件的通用格式,常用来存机器人演示数据。
- Zarr 格式Zarr把大型多维数组切块压缩存储的开源格式,扩散策略和 UMI 用它存训练数据。
- RLDS 格式RLDS (Reinforcement Learning Datasets)谷歌提出的按「回合—步」两层组织序列决策数据的标准格式与工具链。
- TFDS(TensorFlow Datasets)TensorFlow Datasets (TFDS)谷歌的开源数据集库,一行代码下载并加载成可训练的数据管道。
- TFRecord 格式TFRecordTensorFlow 的二进制文件格式,把一条条序列化记录顺序拼接存放。
- LeRobot 数据集格式LeRobotDatasetLeRobot 库的标准数据格式,用表格存状态和动作、用视频存相机画面。
- Parquet 格式Apache Parquet按列存储的开源数据文件格式,LeRobot 数据集用它存状态、动作等数值数据。
- WebDataset 格式WebDataset把训练样本按同名文件打包进一串 tar 分片,方便大规模顺序读取的数据格式。
- MCAP 格式MCAPFoxglove 推出的开源多模态日志文件格式,ROS 2 录包默认用它。
9.9清洗、标注与配比
有了原始数据还要加工:清洗质检、补标注,再挑选、按比例混合后才拿去训练。
- 数据清洗Data Cleaning训练前找出并修正或剔除坏数据,如失败轨迹、空动作、错位帧。
- 空操作 / 静止帧过滤No-op (Idle) Action Filtering训练前删掉示教里机器人没动的时间步,避免模型学会「原地卡住」。
- 数据质检Data Quality Inspection训练前逐条检查采到的机器人数据能不能用,把坏数据挑出来。
- 轨迹回放Trajectory / Episode Replay把录好的动作序列重新发给机器人或仿真器执行,检查数据能不能复现。
- 数据脱敏Data Anonymization / De-identification把数据里的人脸、车牌、声音等个人信息模糊或删除,使其认不出具体的人。
- 数据标注Data Annotation给原始数据补上文字说明、分段、框选等标签,告诉模型每段数据是什么。
- 语言标注Language Annotation给机器人轨迹配上自然语言描述,如「把红杯子放进水槽」,让模型能听指令。
- 子任务切分Subtask Segmentation把一条长演示按步骤切成若干段,标出每段起止帧和说明。
- 自动标注Auto-labeling用预训练模型或程序代替人工,自动给机器人数据补上语言指令、检测框等标签。
- 玩耍数据Play Data操作员不按具体任务、随意摆弄场景时录下的机器人数据。
- 事后重标注Hindsight Relabeling数据采完后,按轨迹实际做成了什么,重新给它贴目标或指令标签。
- 指令增强Instruction Augmentation给机器人轨迹自动补写或改写语言指令,让同一段动作配上更多种说法。
- 数据多样性Data Diversity训练数据在场景、物体、任务、视角等维度上变化有多广。
- 数据缩放律(模仿学习)Data Scaling Laws in Imitation Learning (Robotic Manipulation)研究机器人模仿学习里数据怎么增加、泛化能力就怎么提升的规律。
- 野外数据In-the-wild Data在家庭、办公室、户外等非实验室环境采集的数据,场景多样且不受控制。
- 次优演示Suboptimal / Noisy Demonstrations带多余动作、犹豫、失误,或质量参差不齐的人类示范数据。
- 数据筛选Data Curation从大量机器人数据里挑出真正对训练有益的部分,剔除有害样本。
- 数据检索Data Retrieval (Retrieval-based Data Selection)拿少量目标任务演示去大数据集里找相似片段,合起来训练策略。
- 数据配比Data Mixture多来源数据混合训练时,每个来源各占多大比重。
- Magic Soup(OXE 数据配方)OXE Magic Soup (Octo / OpenVLA dataset mixture)Octo、OpenVLA 预训练时从 OXE 挑选并加权混合子数据集的配方
- 数据泄漏 / 测试集污染Data Leakage / Test-set Contamination测试时才该有的信息在训练中被模型提前看到,导致评测分数虚高。
9.10规模化:数采厂到数据飞轮
最后看怎么把数据量做上去:数采厂、众包、机器人自采,直到部署回流形成飞轮。
- 具身智能训练场Embodied AI Training Ground (Robot Data Collection Center)按真实场景搭建、让大批机器人集中采集训练数据的场地。
- 数采员Data Collector (Teleoperator)专门给机器人录训练数据的人,靠遥操作或穿戴设备示范动作。
- 采集 SOPData Collection Standard Operating Procedure规定每条数据怎么采、采成什么样才算合格的标准操作流程。
- 有效数据Valid (Usable) Data采集到的原始数据里,通过质检、真正能拿去训练模型的那一部分。
- 众包采集Crowdsourced Data Collection把采集任务分发给大量非专业人员,按审核通过的有效数据量付费。
- RoboTurkRoboTurk: A Crowdsourcing Platform for Robotic Skill Learning through Imitation斯坦福 2018 年推出的平台,用手机远程遥操作、众包采集机器人演示。
- 自主数据采集Autonomous Data Collection让机器人自己提出任务、动手尝试并记录结果,少用或不用人工遥操作来积累数据。
- 失败数据Failure Data没完成任务的轨迹,可用来学纠错、训练奖励模型和价值函数。
- 干预数据Human Intervention Data机器人自主执行快出错时,人接管操控,把这段人工纠正记录下来的数据。
- 纠偏数据Recovery and Correction Data专门记录机器人快要出错或已经出错时怎样回到正轨的演示数据。
- 数据回流Deployment Data Backflow把机器人实际部署中产生的数据送回训练,更新模型后再部署。
- 数据飞轮Data Flywheel部署产生数据、数据改进模型、更好的模型再多部署,循环加速的机制。