具身智能新手名词表English

特权信息

Privileged Information常用

只在训练时能拿到、部署时拿不到的额外信息,如仿真里的真实地形和摩擦系数。

这个说法来自 Vapnik 和 Vashist 2009 年提出的「使用特权信息学习」(LUPI):训练时有额外信息辅助,测试时没有。在机器人里,它通常指仿真器能直接读出、真机传感器测不到的量,如地形高度、足端接触力、摩擦系数、外力扰动。只用真机能拿到的观测直接做强化学习往往学不动,常见做法是先训练一个能看到特权信息的教师策略,再蒸馏给只用本体感知或相机的学生策略(教师-学生蒸馏);也可以只让评论家(估计价值的网络)看特权信息,即非对称演员-评论家。

例子ETH 的 ANYmal 四足(Lee 等,Science Robotics 2020):教师策略在仿真里能看到地形轮廓、足端接触状态与接触力、摩擦系数和外力扰动;学生策略只用关节、IMU 等本体感知的历史去模仿教师,最后直接部署到真机,走过泥地、雪地、碎石和茂密植被。

也叫
特权观测、Privileged Observation、特权学习、Learning Using Privileged Information、LUPI
相关
教师-学生蒸馏、非对称演员-评论家、仿真到现实迁移、快速运动适应、本体感知、知识蒸馏
来源
Learning Quadrupedal Locomotion over Challenging Terrain (Lee et al., Science Robotics 2020)
Learning by Cheating (Chen et al., CoRL 2019)

在完整名词表里查看 →