具身智能新手名词表English

监督微调

Supervised Fine-TuningSFT常用

用「输入—标准答案」成对数据,在预训练模型上继续做有监督训练。

监督微调指拿一个预训练好的模型,在整理好的高质量标注数据上继续训练,让它学会某种具体行为;训练目标就是让输出尽量贴近给定答案(语言输出用交叉熵,连续动作常用 L1 或均方误差)。这个叫法因 OpenAI 2022 年的 InstructGPT 流行:先用人写的示范回答做 SFT,再训练奖励模型、做 RLHF,成为大模型后训练的经典三步。机器人里,SFT 通常指在某台机器人、某些任务的遥操作演示上微调 VLA 等基础模型,本质就是行为克隆。它简单稳定,但只会模仿演示,遇到演示里没出现过的状态容易出错,所以常在 SFT 之后再接强化学习微调。

例子斯坦福的 OpenVLA-OFT 改进了 OpenVLA 的微调方式(并行解码、动作分块、连续动作表示加 L1 回归),在 LIBERO 仿真基准上把成功率从 76.5% 提升到 97.1%,动作生成吞吐提高 26 倍。

也叫
有监督微调、监督式微调
相关
微调、行为克隆、后训练、指令微调、强化学习微调、基于人类反馈的强化学习
来源
Training language models to follow instructions with human feedback (InstructGPT, arXiv 2203.02155)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT, arXiv 2502.19645)

在完整名词表里查看 →