互联网图文数据
Web-scale Vision-Language Data常用从网上收集的海量图片-文字配对及图文问答数据,让模型认识大千世界。
指从网页收集的大规模图像-文本对,以及由此整理出的图像描述、视觉问答、目标检测等数据。例如 LAION-5B 从 Common Crawl 网页里用 CLIP 打分筛出 58.5 亿对图文。视觉语言模型(VLM)在这类数据上预训练,所以认得大量物体并掌握不少常识。机器人数据规模小得多,覆盖的物体和场景有限,VLA 模型要借网上的知识主要靠两步:拿互联网数据预训练过的 VLM 当骨干;训练时把网络数据和机器人数据一起协同训练,防止机器人微调把原有知识冲掉。RT-2 最早系统验证了这种做法,π0.5 也把 web 数据列为协同训练的数据源之一。
例子RT-2 把机器人轨迹和视觉问答等网络数据混在一起微调,模型因此能把网上学到的物体和概念用到动作上,执行机器人数据里没出现过的指令。
- 也叫
- 网络图文数据、web 数据、Web Data、Internet-scale Vision-Language Data
- 相关
- 视觉语言模型、协同训练、视觉-语言-动作模型、RT-2、灾难性遗忘、知识隔离
- 来源
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
LAION-5B: An open large-scale dataset for training next generation image-text models
π0.5: a Vision-Language-Action Model with Open-World Generalization - 信息截至
- 2025-04