MuZero
MuZero (Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model)进阶DeepMind 不给规则、靠学到的内部模型做树搜索就精通围棋和 Atari 的算法
DeepMind 的 Julian Schrittwieser、David Silver 等人 2019 年 11 月发布预印本,2020 年 12 月发表于《自然》,是 AlphaGo、AlphaZero 的后继。AlphaZero 下棋时要知道规则才能在「脑中」推演,MuZero 不再需要规则:它学一个隐空间模型,只预测对决策最有用的三样东西,即奖励、策略和价值,而不去重建完整的画面,然后用蒙特卡洛树搜索在这个学到的模型里往前推演、挑选动作。它在围棋、国际象棋、将棋上达到 AlphaZero 的水平,并在 57 款 Atari 游戏上超过了当时所有算法。它是基于模型的强化学习的代表,体现了「世界模型只需为规划服务」的思路,常和 Dreamer 系列一起讨论。
例子玩 Atari 游戏时,MuZero 从未被告知游戏规则,只看画面和得分,就在自己学到的内部模型里预演几步不同操作的后果,选预期回报最高的那一步。
- 相关
- 基于模型的强化学习、世界模型、蒙特卡洛树搜索、隐空间世界模型、价值函数、DreamerV3
- 来源
- Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model (arXiv 1911.08265)
MuZero: Mastering Go, chess, shogi and Atari without rules (Google DeepMind blog) - 信息截至
- 2020-12