监督学习
Supervised Learning入门必知用「输入 + 标准答案」成对的数据训练模型,让它学会从输入预测答案。
监督学习是最常见的机器学习范式:训练数据里每个输入都配有正确输出(标签,也叫真值),模型不断缩小自己的预测与标签之间的差距(用损失函数衡量),最终目标是在没见过的新数据上也能预测对,也就是泛化。输出是类别时叫分类,输出是连续数值时叫回归。与之相对的是没有标签的无监督学习,以及靠奖励信号学习的强化学习。在具身智能里,行为克隆本质上就是监督学习:把人类示范中的观测当输入、动作当标签,训练策略去模仿。
例子用遥操作采集 1000 条「相机画面 → 机械臂关节角」数据,训练一个网络输入画面、输出关节角,损失取预测关节角与示范关节角的均方误差——这就是以监督学习形式做的行为克隆。
- 也叫
- 有监督学习
- 相关
- 行为克隆、无监督学习、强化学习、损失函数、真值、监督微调
- 来源
- Wikipedia: Supervised learning