基于模型的强化学习
Model-Based Reinforcement LearningMBRL常用先学一个能预测环境反应的模型,再靠它规划或「想象」来训练策略。
强化学习的一大分支。智能体除了学策略,还专门学一个环境模型(也叫动力学模型或世界模型):输入当前状态和动作,预测下一个状态和奖励。有了模型,可以先在模型里推演再行动(如模型预测控制),也可以在模型里生成大量「想象」轨迹来训练策略,Sutton 提出的 Dyna 架构就是早期代表。好处是省真实交互、样本效率高,这对试错成本很高的真机尤其重要;风险是模型不准时,策略会钻模型的漏洞(模型偏差)。Dreamer 系列、TD-MPC2 都属于这一类,它也是世界模型研究和机器人强化学习的交汇点。
例子DayDreamer(2022)把 Dreamer 算法直接用在真机上:四足机器人不借助仿真器,只用 1 小时就从零学会翻身、站起和行走。
- 也叫
- Model-Based RL、有模型强化学习
- 相关
- 无模型强化学习、世界模型、想象中学习、样本效率、DreamerV3、模型预测控制
- 来源
- OpenAI Spinning Up: Kinds of RL Algorithms
Model-based Reinforcement Learning: A Survey (Moerland et al.)
DayDreamer: World Models for Physical Robot Learning