具身智能新手名词表English

软演员-评论家

Soft Actor-CriticSAC常用

在追求高回报的同时鼓励动作保持随机的异策略强化学习算法。

SAC 由伯克利 Tuomas Haarnoja、Sergey Levine 等人 2018 年提出(ICML 2018)。它属于演员-评论家方法:「演员」是输出动作的策略网络,「评论家」是估计动作好坏的 Q 函数。核心是最大熵目标:在最大化回报的同时让策略尽量随机(熵高),以鼓励探索、避免过早收敛到次优解,随机程度由温度系数 α 控制,后续版本可自动调节 α。它是异策略算法,能反复利用经验回放里的旧数据,因此样本效率高、对超参数不敏感,只用于连续动作空间。实现上同时学两个 Q 网络并取较小值,以抑制 Q 值高估。SAC 是真机强化学习的常用底座,SERL、HIL-SERL 用的 RLPD 算法就是在 SAC 基础上改进的。

例子SAC 的扩展论文把它用在真机上:Minitaur 四足机器人约 2 小时学会行走,Sawyer 机械臂约 2 小时学会堆积木,灵巧手直接从图像学会转阀门约需 20 小时。

也叫
SAC 算法、最大熵演员-评论家
相关
异策略、熵正则化、Q 函数、经验回放、双延迟深度确定性策略梯度、SERL
来源
Soft Actor-Critic: Off-Policy Maximum Entropy Deep RL with a Stochastic Actor (arXiv 1801.01290)
Soft Actor Critic—Deep Reinforcement Learning with Real-World Robots (BAIR Blog, 2018)
Soft Actor-Critic (OpenAI Spinning Up)

在完整名词表里查看 →