微调
Fine-tuning入门必知在已训练好的模型上,用新任务的少量数据继续训练,让它更擅长这件事。
微调是迁移学习最常见的做法:拿一个预训练好的模型当起点,用目标任务的数据继续训练,而不是从随机参数开始,这样能复用模型已学到的通用知识,省数据也省算力。按更新范围分,全参数微调改动所有权重;也可以冻结大部分层只训一部分,或用 LoRA(低秩适配,插入少量可训练的小矩阵)这类参数高效方法,只训练很少的参数。在具身智能里,拿到开源 VLA 后,用自己机器人采的演示数据微调,是最常见的上手方式。数据太少或训得太久容易过拟合,也可能让模型忘掉原有能力,即灾难性遗忘。
例子openpi 文档给出的参考:π0 做 LoRA 微调需要 22.5 GB 以上显存(如 RTX 4090),全参数微调需要 70 GB 以上(如 A100 / H100)。
- 也叫
- finetune、Finetuning、精调
- 相关
- 预训练、后训练、全参数微调、低秩适配、监督微调、灾难性遗忘
- 来源
- Wikipedia: Fine-tuning (deep learning)
Google Machine Learning Glossary: fine-tuning
GitHub: Physical-Intelligence/openpi