马尔可夫决策过程
Markov Decision ProcessMDP常用描述智能体看状态、做动作、拿奖励、进入新状态这一循环的标准数学框架。
马尔可夫决策过程是强化学习的标准数学模型,常写成五元组 (S, A, P, R, γ):状态空间、动作空间、状态转移概率(在状态 s 做动作 a 后到达下一状态的概率)、奖励函数,以及让远期奖励打折的折扣因子。核心假设是马尔可夫性:下一步只取决于当前状态和动作,与更早的历史无关。它的数学基础来自 Richard Bellman 1957 年前后的动态规划工作,贝尔曼方程、价值函数、策略梯度都建立在它之上。强化学习的目标就是在 MDP 中找一个策略,使期望累计折扣回报最大。真实机器人往往看不全状态(如被挡住的物体),这时要用部分可观测马尔可夫决策过程(POMDP)建模,实践中常靠输入历史观测弥补。
例子训练四足机器人行走时,状态可以包括关节角度、关节速度、机身姿态和速度指令,动作是 12 个关节的目标角度,奖励按跟上指令速度加分、按能耗和摔倒扣分,策略每个控制周期根据当前状态输出一次动作。
- 也叫
- 马氏决策过程
- 相关
- 强化学习、部分可观测马尔可夫决策过程、贝尔曼方程、奖励函数、折扣因子、策略
- 来源
- Markov decision process(Wikipedia)