具身智能新手名词表English

贝尔曼方程

Bellman Equation常用

把一个状态的价值拆成「眼前奖励 + 下一状态打折后的价值」的递推式。

贝尔曼方程以美国数学家 Richard Bellman 命名,出自他提出的动态规划方法。它说的是:某个状态的价值 = 在这里拿到的即时奖励 + 折扣因子 × 下一个状态的期望价值。这样就把「长远看有多好」这个难算的问题拆成一步步的递推。按固定策略写出的叫贝尔曼期望方程,对动作取最大值的叫贝尔曼最优方程。几乎所有基于价值的强化学习都建立在它之上:Q 学习、深度 Q 网络(DQN)、时序差分学习都用它构造训练目标,让网络的预测满足这种前后自洽的关系。

例子Q 学习的训练目标是 r + γ·max Q(s', a'):机器人在状态 s 执行动作 a、拿到奖励 r 并到达 s',就用这个目标去更新 Q(s, a),这就是在用贝尔曼最优方程。

也叫
Bellman 方程、贝尔曼最优方程、贝尔曼期望方程
相关
价值函数、Q 函数、折扣因子、时序差分学习、Q 学习、马尔可夫决策过程
来源
Wikipedia: Bellman equation
OpenAI Spinning Up: Key Concepts in RL

在完整名词表里查看 →