Q 学习
Q-Learning常用用「即时奖励 + 下一状态最大 Q 值」反复修正 Q 值的经典无模型强化学习算法。
Q 学习由 Chris Watkins 在 1989 年的博士论文中提出,1992 年他与 Peter Dayan 给出收敛证明。它不需要环境模型:每走一步,就用「即时奖励 + 折扣 × 下一状态的最大 Q 值」作为目标修正当前 Q 值,这种用自己的估计更新自己的做法属于时序差分学习。它是异策略算法:采数据时用 ε-贪心随机探索,学到的却是贪心的最优策略,旧数据能反复利用。早期用表格存 Q 值,只适合小规模离散问题;DeepMind 用神经网络代替表格做出了 DQN。max 操作会让 Q 值偏高,双 Q 学习专门修正这一点。
例子QT-Opt(Google,2018)用 58 万多次真实抓取数据训练基于 Q 学习的视觉抓取策略,对训练时没见过的物体抓取成功率达到 96%。
- 也叫
- Q-learning、表格型 Q 学习
- 相关
- Q 函数、时序差分学习、深度 Q 网络、异策略、Q 值高估、QT-Opt
- 来源
- Wikipedia: Q-learning
Hugging Face Deep RL Course: Introducing Q-Learning
QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation