指令微调
Instruction Tuning进阶用「指令—回答」格式的多任务数据微调模型,让它学会听指令办事。
指令微调是在预训练模型上,用大量以自然语言指令描述的任务样本(指令 + 期望输出)做监督微调。2021 年 Google 的 FLAN 工作把一个 1370 亿参数模型在 60 多个 NLP 任务上做指令微调,零样本表现在 25 个评测任务中的 20 个超过 GPT-3。它让模型从「续写文本」变成「按要求办事」,是对话助手的基础步骤之一。多模态里,LLaVA 用 GPT-4 生成图文指令数据做「视觉指令微调」;很多 VLA 的骨干 VLM 经历过这一步,训练 VLA 时也常把这类数据混进来,减少遗忘。
例子LLaVA(2023)用 GPT-4 把图片的文字描述改写成「看图回答问题」式的指令数据,再用它微调「视觉编码器 + 语言模型」的组合,得到能看图对话的助手。
- 也叫
- 指令调优、Instruction Fine-tuning
- 相关
- 监督微调、大语言模型、视觉语言模型、LLaVA(视觉指令微调架构)、零样本、后训练
- 来源
- Finetuned Language Models Are Zero-Shot Learners (FLAN, arXiv:2109.01652)
Visual Instruction Tuning (LLaVA, arXiv:2304.08485)