更新-数据比
Update-to-Data RatioUTD进阶每采集一步环境数据做几次梯度更新;越高越省数据,也越费算力。
更新-数据比指离策略强化学习里,每和环境交互一步、往经验回放里加一条数据后,网络做多少次梯度更新。标准 SAC 通常取 1。真机强化学习里采数据慢而贵,算力相对便宜,于是希望调高这个比值,把同一批数据多学几遍。但直接调高容易让 Q 函数过拟合和高估,训练变差。REDQ(ICLR 2021)用 Q 网络集成,首次让无模型算法在 UTD 远大于 1 时稳定工作;DroQ 改用 dropout 和层归一化,计算更省。SERL 等真机强化学习框架依赖高 UTD 提高样本效率,并把采集和训练拆成两个线程。
例子「A Walk in the Park」(2022)在宇树 A1 四足上以 SAC 为基础,加层归一化并把 UTD 提到 20,即每采一步数据做 20 次评论家更新,约 20 分钟真机训练学会行走。
- 也叫
- UTD 比、UTD Ratio、重放比、Replay Ratio
- 相关
- 样本效率、经验回放、异策略、真机强化学习、SERL、Q 值高估
- 来源
- Chen et al. 2021: Randomized Ensembled Double Q-Learning: Learning Fast Without a Model (REDQ, ICLR 2021)
Smith, Kostrikov, Levine 2022: A Walk in the Park: Learning to Walk in 20 Minutes With Model-Free Reinforcement Learning
Luo et al. 2024: SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning