具身智能新手名词表English

校准 Q 学习

Calibrated Q-LearningCal-QL进阶

给保守 Q 学习加「校准」约束,让离线预训练后能平滑转入在线微调。

Cal-QL 由 Nakamoto、Chelsea Finn、Aviral Kumar、Sergey Levine 等人在 2023 年提出,发表于 NeurIPS 2023,面向离线到在线强化学习:先用固定数据集离线预训练,再上环境在线微调。作者发现,用保守 Q 学习(CQL)预训练得到的 Q 值被压得过低,比任何正常策略的真实回报都小;一开始在线微调,Q 值剧烈调整尺度,策略会先把离线学到的东西「忘掉」,性能掉一截再慢慢爬回来。Cal-QL 加了一个校准约束:学到的 Q 值仍是当前策略真实价值的下界,但不能低于某个参考策略的价值,实践中参考策略就用数据集的行为策略,其价值用蒙特卡洛回报估计。实现上只需在 CQL 代码上改一行,在 11 个微调基准任务中 9 个超过已有方法。

例子Cal-QL 论文的测试任务包括 FrankaKitchen(控制 9 自由度 Franka 机械臂按顺序完成厨房子任务)和 Adroit(28 自由度五指手转笔、开门等),流程都是先离线预训练、再在线微调。

也叫
Calibrated Offline RL Pre-Training
相关
保守 Q 学习、离线到在线强化学习、离线强化学习、Q 函数、强化学习微调、利用先验数据的强化学习
来源
Cal-QL: Calibrated Offline RL Pre-Training for Efficient Online Fine-Tuning (arXiv 2303.05479)

在完整名词表里查看 →