具身智能新手名词表English

分层强化学习

Hierarchical Reinforcement LearningHRL进阶

把决策拆成高层定子目标、低层执行具体动作的多层强化学习。

长任务如果直接从底层动作学起,奖励要隔很久才出现,信用分配(判断是哪一步导致了结果)很难。分层强化学习让高层策略以较低频率选子目标或技能,低层策略以较高频率输出具体动作去完成它。经典框架有 Sutton 等人 1999 年的选项(options)框架,以及 Dayan 与 Hinton 的封建式强化学习;深度学习时代有 DeepMind 2017 年的 FeUdal Networks(管理者设目标、执行者出动作),和 2018 年 Nachum、Levine 等人的 HIRO(高层给低层下发目标,并对旧数据做异策略修正)。今天具身智能里大模型规划加底层技能、快慢双系统等分层架构与它思路相通,但不一定用强化学习训练。

例子HIRO 在仿真四足「蚂蚁」机器人走迷宫等任务中,高层每隔固定步数给出一个期望状态作为子目标,低层控制各条腿去达到它。

相关
分层架构、快慢双系统、原子技能、长程任务、目标条件强化学习、信用分配
来源
FeUdal Networks for Hierarchical Reinforcement Learning (arXiv 1703.01161)
Data-Efficient Hierarchical Reinforcement Learning (HIRO, NeurIPS 2018)

在完整名词表里查看 →