自举
Bootstrapping (in RL)进阶用自己对下一状态价值的当前估计,来更新当前状态的价值估计。
自举是强化学习中更新价值函数的一种基本做法:更新时部分依赖已有的价值估计,而不是只依赖实际拿到的奖励。时序差分(TD)学习是典型例子,更新某一步的价值时,目标取「这一步的奖励 + 折扣后的下一状态价值估计」,不用等整局结束;与之相对,蒙特卡洛方法必须跑完一整个回合,用实际回报来更新。自举的好处是每一步都能学、方差小、能用于没有终点的任务;代价是目标本身带偏差,估计误差会一路传下去。自举、神经网络这类函数近似、异策略学习三者同时出现时训练容易不稳定,被称为「致命三角」,DQN 的经验回放和目标网络就是为稳定训练而设计的。它和统计学里的 bootstrap 重抽样不是一回事。
例子机械臂开抽屉,每步奖励为 0、抽屉拉开时得 1。TD 学习更新「已握住把手」这个状态的价值时,直接拿「抽屉已拉开一半」状态当前的价值估计乘以折扣因子当目标,不必等这一回合结束。
- 也叫
- 自举法、Bootstrap
- 相关
- 时序差分学习、价值函数、贝尔曼方程、目标网络、蒙特卡洛方法(蒙特卡洛回报)、Q 值高估
- 来源
- Lilian Weng: A (Long) Peek into Reinforcement Learning
Wikipedia: Temporal difference learning