强化学习运控
RL-based Locomotion Control常用在仿真里用强化学习训练神经网络,直接控制腿足机器人行走的方法。
强化学习运控指用强化学习(在试错中最大化奖励)训练神经网络控制器,让四足、人形等腿足机器人行走、奔跑、摔倒后起身。典型流程是:在 Isaac Gym、Isaac Lab 等 GPU 仿真器里并行跑数千个机器人,用 PPO 训练;策略以约 50 Hz 输出关节目标角度,由关节 PD 控制器换算成力矩;再借域随机化、执行器建模等手段跨过虚实差距部署到真机。ETH 的 Hwangbo 等人 2019 年在 ANYmal 四足上验证了这条路线,Rudin 等人 2021 年用单块 GPU 把平地行走的训练缩短到 4 分钟以内。相比 MPC 加全身控制等基于模型的方法,它不用手写步态和精确模型、对复杂地形更鲁棒,但依赖奖励设计和大量调参。
例子在宇树开源的 unitree_rl_gym 里训练 Go2:仿真步长 5 毫秒、每 4 步更新一次动作,即策略每 20 毫秒输出 12 个关节的目标角度,底层用 Kp=20、Kd=0.5 的 PD 控制跟踪,训练好后导出网络部署到真机。
- 也叫
- RL 运控、基于强化学习的运动控制
- 相关
- 腿足运动、仿真到现实迁移、域随机化、近端策略优化、刚度与阻尼增益、速度指令跟踪
- 来源
- Learning agile and dynamic motor skills for legged robots (Hwangbo et al., Science Robotics 2019)
Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (Rudin et al.)
unitree_rl_gym:Go2 训练配置 - 信息截至
- 2026-09