校准 Q 学习
Calibrated Q-LearningCal-QL进阶给保守 Q 学习加「校准」约束,让离线预训练后能平滑转入在线微调。
Cal-QL 由 Nakamoto、Chelsea Finn、Aviral Kumar、Sergey Levine 等人在 2023 年提出,发表于 NeurIPS 2023,面向离线到在线强化学习:先用固定数据集离线预训练,再上环境在线微调。作者发现,用保守 Q 学习(CQL)预训练得到的 Q 值被压得过低,比任何正常策略的真实回报都小;一开始在线微调,Q 值剧烈调整尺度,策略会先把离线学到的东西「忘掉」,性能掉一截再慢慢爬回来。Cal-QL 加了一个校准约束:学到的 Q 值仍是当前策略真实价值的下界,但不能低于某个参考策略的价值,实践中参考策略就用数据集的行为策略,其价值用蒙特卡洛回报估计。实现上只需在 CQL 代码上改一行,在 11 个微调基准任务中 9 个超过已有方法。
例子Cal-QL 论文的测试任务包括 FrankaKitchen(控制 9 自由度 Franka 机械臂按顺序完成厨房子任务)和 Adroit(28 自由度五指手转笔、开门等),流程都是先离线预训练、再在线微调。
- 也叫
- Calibrated Offline RL Pre-Training
- 相关
- 保守 Q 学习、离线到在线强化学习、离线强化学习、Q 函数、强化学习微调、利用先验数据的强化学习
- 来源
- Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning (arXiv 2303.05479)