具身智能新手名词表English

策略蒸馏

Policy Distillation进阶

让一个学生策略模仿一个或多个训好的老师策略,把本事压缩或合并进来。

策略蒸馏是知识蒸馏在决策问题上的用法:学生策略不直接从奖励中学,而是去拟合老师策略在各个状态下输出的动作或动作分布。DeepMind 的 Rusu 等人 2015 年在 Atari 游戏上系统提出这一做法,一是把大网络压成小网络,二是把多个单游戏专家合并成一个多任务策略,合并后的表现超过各自单独训练的版本。机器人里常见的是「专家到通才」:先针对不同物体、任务,或借助特权信息(只在仿真里拿得到的真值状态)分别训练专用策略,再蒸馏进一个通用策略,常配合 DAgger 在学生自己走到的状态上向老师要标签。

例子北大王鹤团队的 UniDexGrasp++ 先按物体几何特征把数千个物体分组,各训练一个专家抓取策略,再迭代蒸馏成一个通才策略,最终在训练集和测试集物体上的抓取成功率分别为 85.4% 和 78.2%。

也叫
专家到通才蒸馏、Specialist-to-Generalist Distillation
相关
知识蒸馏、教师-学生蒸馏、专用策略、通用策略(通才策略)、DAgger(数据集聚合)、在线策略蒸馏
来源
Rusu et al. 2015: Policy Distillation
Wan et al. 2023: UniDexGrasp++
He et al. 2024: HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots

在完整名词表里查看 →