具身智能新手名词表English

指令微调

Instruction Tuning进阶

用「指令—回答」格式的多任务数据微调模型,让它学会听指令办事。

指令微调是在预训练模型上,用大量以自然语言指令描述的任务样本(指令 + 期望输出)做监督微调。2021 年 Google 的 FLAN 工作把一个 1370 亿参数模型在 60 多个 NLP 任务上做指令微调,零样本表现在 25 个评测任务中的 20 个超过 GPT-3。它让模型从「续写文本」变成「按要求办事」,是对话助手的基础步骤之一。多模态里,LLaVA 用 GPT-4 生成图文指令数据做「视觉指令微调」;很多 VLA 的骨干 VLM 经历过这一步,训练 VLA 时也常把这类数据混进来,减少遗忘。

例子LLaVA(2023)用 GPT-4 把图片的文字描述改写成「看图回答问题」式的指令数据,再用它微调「视觉编码器 + 语言模型」的组合,得到能看图对话的助手。

也叫
指令调优、Instruction Fine-tuning
相关
监督微调、大语言模型、视觉语言模型、LLaVA(视觉指令微调架构)、零样本、后训练
来源
Finetuned Language Models Are Zero-Shot Learners (FLAN, arXiv:2109.01652)
Visual Instruction Tuning (LLaVA, arXiv:2304.08485)

在完整名词表里查看 →