具身智能新手名词表English

异策略

Off-Policy常用

用来学习的数据可以来自别的策略,不必由当前策略亲自采集。

强化学习里区分两种策略:行为策略负责与环境交互、产生数据,目标策略是正在学习和优化的那个。两者可以不同,就叫异策略学习。这样,旧版本策略的经验、人类演示、其他算法的数据都能存进经验回放缓冲区反复使用,样本效率高,Q 学习、DQN、DDPG、TD3、SAC 都属于这一类。代价是数据分布和当前策略不一致,训练更容易不稳定。真机强化学习因为交互昂贵,多选异策略算法。注意:中文「离线策略」常指异策略,但它和「离线强化学习」不是一回事,异策略算法通常仍在一边训练一边采集新数据。

例子SERL 用基于 SAC 的异策略算法 RLPD,每个训练批次一半来自人类演示、一半来自机器人在线采集的回放数据,在 PCB 插装、理线等任务上平均 25 到 50 分钟训出策略。

也叫
离策略、离轨策略、离线策略、Off-Policy Learning
相关
同策略、经验回放、软演员-评论家、Q 学习、离线强化学习、SERL
来源
OpenAI Spinning Up: Kinds of RL Algorithms
Wikipedia: State–action–reward–state–action (SARSA vs Q-learning)
SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning

在完整名词表里查看 →