预训练
Pre-training入门必知先在海量通用数据上训练出一个基础模型,之后再针对具体任务去适配。
预训练是训练基础模型的第一阶段:用规模大、覆盖广的数据(网页文本、图文对、视频、多种机器人的操作数据等)训练模型,让它学到通用的表示和能力。得到的模型叫预训练模型或基座模型,之后再通过微调或后训练用到具体的下游任务上。它的价值在于把昂贵的通用学习集中做一次,下游任务只需少量数据。具身智能里的预训练通常分两层:VLA 先继承一个已在互联网图文上预训练过的视觉语言模型,再在大规模、多种机器人的数据上继续训练,比如 π0 用了 1 万多小时的机器人数据。
例子OpenVLA(7B 参数)以 Llama 2 语言模型加 DINOv2、SigLIP 视觉编码器为底座,在 Open X-Embodiment 的 97 万条真实机器人演示上预训练,之后可用 LoRA 在消费级显卡上微调到新任务。
- 也叫
- Pretraining、预训练阶段
- 相关
- 后训练、微调、基础模型、下游任务、缩放定律、自监督学习
- 来源
- Google Machine Learning Glossary: pre-trained model
Kim et al. 2024: OpenVLA: An Open-Source Vision-Language-Action Model
Black et al. 2024: π0: A Vision-Language-Action Flow Model for General Robot Control