Gym MuJoCo 连续控制任务
Gym/Gymnasium MuJoCo Tasks (HalfCheetah, Hopper, Walker2d, Ant, Humanoid)进阶Gymnasium 里基于 MuJoCo 的一组经典连续控制环境,强化学习论文的常用考题。
最早随 OpenAI Gym 发布、现由 Farama 基金会的 Gymnasium 维护的一组 MuJoCo 物理仿真环境,共 11 个,最常用的是 HalfCheetah(二维猎豹奔跑)、Hopper(单腿跳)、Walker2d(二维双足行走)、Ant(四足)和 Humanoid(人形)。动作是连续的关节力矩,奖励大致是「往前越快越好,减去动作能耗」,一回合最多 1000 步。SAC、TD3、PPO 等强化学习算法都拿它们报分,D4RL 离线数据集也基于其中几个。它们只考运动控制,不涉及视觉和真机细节,适合入门和对比算法。当前推荐 v5 版(需 mujoco≥2.3.3),不同版本的分数不能直接比。
例子HalfCheetah-v5:动作是 6 个关节的力矩(6 维),观测是 17 维关节位置和速度;没有摔倒终止,跑满 1000 步截断,得分 = 前进速度奖励 − 控制代价。
- 也叫
- Gymnasium MuJoCo 环境、MuJoCo 运动控制任务、HalfCheetah / Hopper / Walker2d
- 相关
- MuJoCo、Gymnasium、D4RL 离线强化学习基准、软演员-评论家、近端策略优化、DeepMind 控制套件
- 来源
- Gymnasium Documentation: MuJoCo environments
Gymnasium Documentation: Half Cheetah - 信息截至
- 2026-09