具身智能新手名词表English

强化学习运控

RL-based Locomotion Control常用

在仿真里用强化学习训练神经网络,直接控制腿足机器人行走的方法。

强化学习运控指用强化学习(在试错中最大化奖励)训练神经网络控制器,让四足、人形等腿足机器人行走、奔跑、摔倒后起身。典型流程是:在 Isaac Gym、Isaac Lab 等 GPU 仿真器里并行跑数千个机器人,用 PPO 训练;策略以约 50 Hz 输出关节目标角度,由关节 PD 控制器换算成力矩;再借域随机化、执行器建模等手段跨过虚实差距部署到真机。ETH 的 Hwangbo 等人 2019 年在 ANYmal 四足上验证了这条路线,Rudin 等人 2021 年用单块 GPU 把平地行走的训练缩短到 4 分钟以内。相比 MPC 加全身控制等基于模型的方法,它不用手写步态和精确模型、对复杂地形更鲁棒,但依赖奖励设计和大量调参。

例子在宇树开源的 unitree_rl_gym 里训练 Go2:仿真步长 5 毫秒、每 4 步更新一次动作,即策略每 20 毫秒输出 12 个关节的目标角度,底层用 Kp=20、Kd=0.5 的 PD 控制跟踪,训练好后导出网络部署到真机。

也叫
RL 运控、基于强化学习的运动控制
相关
腿足运动、仿真到现实迁移、域随机化、近端策略优化、刚度与阻尼增益、速度指令跟踪
来源
Learning agile and dynamic motor skills for legged robots (Hwangbo et al., Science Robotics 2019)
Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (Rudin et al.)
unitree_rl_gym:Go2 训练配置
信息截至
2026-09

在完整名词表里查看 →