World Models 论文(Ha & Schmidhuber)
World Models (Ha & Schmidhuber, 2018)进阶2018 年让智能体在自己学出的「梦境」里练策略的经典世界模型论文
David Ha(Google Brain)和 Jürgen Schmidhuber(NNAISENSE)2018 年 3 月发布的论文,同年以《Recurrent World Models Facilitate Policy Evolution》发表于 NeurIPS。智能体分三块:V 用变分自编码器把 64×64 的画面压成几十维向量;M 用混合密度网络加循环神经网络,预测下一时刻向量的概率分布;C 是只有约一千个参数的线性控制器,用进化策略 CMA-ES 训练。关键结果是控制器可以完全在 M 生成的「梦境」里训练,再放回真实的 VizDoom 游戏仍然有效。这篇论文让「世界模型」一词重新流行,Dreamer 系列等后续工作都沿着这条思路发展。
例子在 CarRacing-v0 赛车任务上得分 906±21,高于此前方法的 591–838;在 VizDoom 躲火球任务中,只在梦境里训练的控制器迁回真实游戏得分 1092±556。
- 也叫
- Recurrent World Models、Recurrent World Models Facilitate Policy Evolution
- 相关
- 世界模型、想象中学习、变分自编码器、循环神经网络、混合密度网络、DreamerV3
- 来源
- World Models (arXiv:1803.10122)
World Models 交互式论文页 - 信息截至
- 2018-12