知识蒸馏
Knowledge DistillationKD常用让小的学生模型去模仿大的教师模型的输出,把能力压缩进小模型。
知识蒸馏由 Hinton、Vinyals 和 Dean 在 2015 年的论文中系统提出:先训练一个大而强的教师模型,再让小的学生模型去拟合教师输出的概率分布(称为软标签),而不只拟合真值标签。论文通过调高 softmax 的「温度」让软标签更平滑,暴露出类别之间的相似关系,学生因此能学到更多信息。它解决的是大模型部署贵、推理慢的问题。在具身智能里,蒸馏常以教师-学生形式出现:教师在仿真里使用真机拿不到的特权信息(如地形、接触状态)训练,学生只用真机传感器去模仿教师的动作,从而实现仿真到现实迁移;它也用于把多步去噪的扩散策略蒸馏成少步模型,降低推理延迟。
例子Lee 等人 2020 年发表在 Science Robotics 的 ANYmal 四足工作中,教师策略在仿真里能看到地形真值和足端接触,学生策略只输入本体感知历史、通过模仿教师来学习,最终零样本部署到泥地、雪地、碎石等野外地形。
- 也叫
- 蒸馏、模型蒸馏
- 相关
- 教师-学生蒸馏、特权信息、策略蒸馏、在线策略蒸馏、KL 散度、扩散步数蒸馏
- 来源
- Distilling the Knowledge in a Neural Network (arXiv 1503.02531)
Learning Quadrupedal Locomotion over Challenging Terrain (Science Robotics 2020, arXiv 2010.11251)