PlaNet
PlaNet: Learning Latent Dynamics for Planning from Pixels进阶从像素学隐空间世界模型、在想象中规划动作的基于模型强化学习智能体
谷歌(Google Brain 与 DeepMind 合作)的 Danijar Hafner 等人 2018 年 11 月发布,ICML 2019 论文。它只看图像,先学一个世界模型:把画面压缩成隐状态,学习隐状态在动作作用下怎么变、能拿多少奖励。模型核心是循环状态空间模型(RSSM),同时有确定性和随机性两条路径,多步预测更稳;论文还提出多步训练目标 latent overshooting。决策时不训练策略网络,而是在隐空间里想象大量候选动作序列、挑预测回报最高的一条,只执行第一步就重新规划(在线规划)。在 DeepMind Control 连续控制任务上,它所需交互回合远少于无模型方法,谷歌博客称平均数据效率约为后者的 50 倍。后来的 Dreamer 系列沿用 RSSM,改成在想象中学策略。
例子在「猎豹奔跑」(cheetah run)任务里,PlaNet 只看摄像头画面,每一步都在隐空间里比较上万条想象出的动作序列,执行预测奖励最高那条的第一步。
- 也叫
- Deep Planning Network
- 相关
- 循环状态空间模型、DreamerV3、世界模型、基于模型的强化学习、模型预测控制、交叉熵方法
- 来源
- arXiv 1811.04551: Learning Latent Dynamics for Planning from Pixels
ICML 2019 论文页(PMLR v97)
Google Research Blog: Introducing PlaNet - 信息截至
- 2019-06