具身智能新手名词表English

多智能体强化学习

Multi-Agent Reinforcement LearningMARL进阶

多个智能体在同一环境里同时学习,彼此合作或竞争的强化学习。

多智能体强化学习研究多个会学习的决策者共享一个环境的情形,按奖励关系分为完全合作(共享同一奖励)、完全竞争(零和博弈,如下棋)和混合型(如自动驾驶车辆各自赶路又都要避免相撞)。与单智能体相比,最大难点是非平稳性:其他智能体也在不断改变策略,对每个智能体来说环境一直在变,单智能体算法的收敛保证随之失效;此外还有信用分配和部分可观测等问题。常用思路是「集中训练、分散执行」,训练时让评论家看到全局信息,执行时各自只看局部观测,如 2017 年的 MADDPG 和 2021 年的 MAPPO。多机器人协作、机器人足球和对抗式自博弈训练都会用到它。

例子MAPPO 让每个作战单位各由一个基于 PPO 的智能体控制,在星际争霸多智能体挑战(SMAC)、谷歌足球等基准上取得了与异策略方法相当甚至更好的成绩。

也叫
多智能体 RL
相关
强化学习、多机器人协作、自博弈、群体智能、部分可观测马尔可夫决策过程、近端策略优化
来源
Albrecht, Christianos, Schäfer: Multi-Agent Reinforcement Learning: Foundations and Modern Approaches (MIT Press, 2024)
Wikipedia: Multi-agent reinforcement learning
Yu et al. 2021: The Surprising Effectiveness of PPO in Cooperative Multi-Agent Games (MAPPO)

在完整名词表里查看 →