具身智能新手名词表English

Stable-Baselines3

SB3进阶

基于 PyTorch 的经典强化学习算法库,接口简单、实现可靠

Stable-Baselines3 是一个基于 PyTorch 的开源强化学习库,由德国宇航中心机器人所(DLR-RM)的 Antonin Raffin 等人维护,是 Stable Baselines(源自 OpenAI Baselines)的继任版本,相关论文 2021 年发表于 JMLR。它提供 PPO、SAC、TD3、DQN、A2C 等算法的可靠实现,几行代码就能在 Gymnasium 环境上训练,文档和测试完善,常被当作入门和对照基线。它主要面向单环境或少量并行环境,大规模 GPU 并行仿真训练时,人们更多用 rsl_rl、rl_games 等。

例子model = PPO(「MlpPolicy」, env); model.learn(100000),几行代码就能在 Gymnasium 的倒立摆任务上训出策略。

相关
强化学习、近端策略优化、软演员-评论家、Gymnasium、CleanRL、skrl
来源
Stable-Baselines3 Docs
DLR-RM/stable-baselines3 (GitHub)

在完整名词表里查看 →