学习型状态估计器
Learned State Estimator (Concurrent Estimator Network)进阶用神经网络从关节和 IMU 数据估出机身速度等量,常与运控策略一起训练。
学习型状态估计器指用神经网络代替或补充卡尔曼滤波,从本体感知数据(关节角、关节速度、IMU 读数的历史)直接回归难以直接测到的状态。代表工作是韩国 KAIST Hwangbo 团队 2022 年发表于 RA-L 的论文:在仿真里同时训练控制策略和估计网络,策略用 PPO 强化学习,估计器用仿真真值做监督学习,估出机身线速度、足端高度和触地概率,再作为策略的输入。这样不需要预设步态,也不需要足底接触传感器,估计器在训练中见过大量随机化的打滑、崎岖场景。论文中四足机器人平地最高速度 3.75 m/s,在摩擦系数 0.22 的湿滑面上达到 3.54 m/s。后续不少足式强化学习运控工作沿用了类似的估计网络。
例子Ji 等人的系统在真机上:估计网络先由本体感知历史估出机身线速度、足端高度和触地概率,策略网络再据此输出期望关节位置,在山坡、湿滑板和颠簸路面上完成了高速行走。
- 也叫
- 状态估计网络、估计器网络、Estimator Network、策略与估计器联合训练
- 相关
- 状态估计、强化学习运控、特权信息、腿式里程计、DreamWaQ、HIM(混合内部模型)
- 来源
- Concurrent Training of a Control Policy and a State Estimator for Dynamic and Robust Legged Locomotion (Ji et al., RA-L 2022, arXiv 2202.05481)