奖励塑形
Reward Shaping常用在任务原始奖励之外加上中间引导分,让智能体更快学会任务。
奖励塑形指在任务本身的奖励(例如只在成功时给 1 分)之外,额外加入对中间进展的奖励,比如机械臂离目标越近分越高。它主要解决稀疏奖励下智能体长时间拿不到反馈、学不动的问题。风险是加错会改变「最优行为」:经典例子是骑自行车的智能体因为「靠近目标有奖励、远离不扣分」,学会绕着目标转小圈。Ng、Harada、Russell 在 1999 年 ICML 论文中证明,只要附加奖励写成势函数之差 F=γΦ(s′)−Φ(s)(Φ 给每个状态打分,γ 是折扣因子),最优策略就不会改变,这叫基于势函数的奖励塑形。具身智能里腿足运控的奖励通常由速度跟踪、姿态、能耗、足端腾空时间等多项加权组成,本质就是大量手工塑形;Eureka 等工作尝试让大模型自动写这类奖励代码。
例子训练机械臂把方块推到目标点:原始奖励只在方块到位时给 1;塑形后每一步再奖励「夹爪到方块的距离缩短了多少」和「方块到目标的距离缩短了多少」,策略在训练早期就能拿到学习信号。
- 也叫
- 奖励整形、奖励成形、基于势函数的奖励塑形、Potential-based Reward Shaping
- 相关
- 稀疏奖励、稠密奖励、奖励函数、奖励工程、奖励黑客、Eureka
- 来源
- Policy Invariance Under Reward Transformations: Theory and Application to Reward Shaping (Ng, Harada, Russell, ICML 1999)
Reward Hacking in Reinforcement Learning (Lilian Weng, 2024)