回报
Return常用从某一时刻起往后所有奖励(通常打折扣)加起来的总和。
回报是强化学习要最大化的量。奖励是每一步环境给的即时分数,回报则是从当前时刻往后所有奖励的总和,常记作 G_t 或 R(τ)。回合有固定长度时可以直接相加;任务很长或没有终点时通常用折扣回报:k 步之后的奖励乘上折扣因子 γ 的 k 次方(γ 在 0 到 1 之间,常取 0.95–0.99),越远的奖励权重越小,既保证总和有限,也让智能体更看重眼前。强化学习的目标是最大化期望回报;价值函数和 Q 函数就是对未来回报的期望估计。回报条件化等方法还把目标回报当作输入,让策略按指定水平去做。
例子机械臂抓取任务只在成功时给 +1、其余为 0,取 γ=0.99:第 10 步成功,从起点算的折扣回报是 0.99^10≈0.904;拖到第 50 步才成功,回报只有约 0.605,所以策略会倾向更快完成。
- 也叫
- 累积奖励、Cumulative Reward、折扣回报、Discounted Return、G_t
- 相关
- 奖励函数、折扣因子、价值函数、Q 函数、回合、回报条件化
- 来源
- OpenAI Spinning Up: Key Concepts in RL
Hugging Face Deep RL Course: The Reinforcement Learning Framework