Q 函数
Q-Function (Action-Value Function)常用在某状态先做某个动作、之后按策略行动,能拿到的期望回报。
Q 函数写作 Q(s,a):在状态 s 先执行动作 a,之后一直按策略 π 行动,所能得到的期望回报(未来奖励的折扣累加)。它比价值函数 V(s) 多了一个动作输入,所以能直接比较同一状态下不同动作的好坏;知道最优 Q 函数后,每步挑 Q 值最大的动作就是最优策略。Q 函数满足贝尔曼方程:当前 Q 值等于即时奖励加上下一步 Q 值的折扣。Q 学习、DQN、SAC、TD3 都在学它;演员-评论家算法里的评论家常常就是一个 Q 网络,优势函数 A(s,a)=Q(s,a)−V(s) 也由它得出。
例子QT-Opt 用一个卷积网络估计 Q 值:输入当前相机图像和一个候选夹爪动作,输出执行后最终抓取成功的概率;每一步用交叉熵方法搜出 Q 值最高的动作去执行。
- 也叫
- 动作价值函数、Q 值、状态-动作价值函数、Action-Value Function、Q(s,a)
- 相关
- 价值函数、优势函数、贝尔曼方程、Q 学习、深度 Q 网络、回报
- 来源
- OpenAI Spinning Up: Key Concepts in RL
Hugging Face Deep RL Course: Introducing Q-Learning