离线策略评估
Off-Policy EvaluationOPE进阶只用其他策略收集的历史数据,估计一个新策略真正部署后能拿到多少回报。
离线策略评估是强化学习里的一类问题:数据由某个行为策略收集,想在不和环境交互的前提下,估计另一个目标策略的期望回报。机器人真机测一次要人看护、会磨损硬件,若能先靠已有日志筛掉差策略,就能省下大量评测成本,也便于离线强化学习挑选检查点和超参数。常见方法有重要性采样(按两个策略选同一动作的概率之比给旧数据重新加权)、拟合 Q 评估(FQE,用数据拟合目标策略的 Q 函数)、双重稳健估计和基于模型的方法。Fu 等人 2021 年的 DOPE 基准除了看估值误差,还用排序相关性和 regret@k 衡量方法能否把好策略挑出来,因为实践中排对顺序往往比估准数值更重要。
例子谷歌 Irpan 等人(NeurIPS 2019)在基于图像的机械臂抓取任务上把 OPE 改写成分类问题,只用离线数据就较可靠地预测了多个策略在真机上的相对优劣,包括仿真到现实迁移的情形。
- 也叫
- 异策略评估、离策略评估、Off-Policy Policy Evaluation
- 相关
- 离线强化学习、异策略、Q 函数、真机评测、世界模型评测、重要性采样
- 来源
- Benchmarks for Deep Off-Policy Evaluation (DOPE, ICLR 2021)
Off-Policy Evaluation via Off-Policy Classification (NeurIPS 2019)