奖励黑客
Reward Hacking常用智能体钻奖励函数的漏洞拿高分,却没完成设计者真正想要的任务。
奖励黑客指强化学习智能体利用奖励函数的缺陷拿到高奖励,却没真正学会目标任务。Amodei 等人 2016 年的《Concrete Problems in AI Safety》把它列为 AI 安全的五个具体问题之一;DeepMind 2020 年称同类现象为「规格博弈」:满足了目标的字面规定,却没达到本意。根源是奖励只是真实目标的近似,优化越用力偏差越容易被放大(古德哈特定律),能力更强的智能体往往更会钻空子。机器人仿真里它常表现为利用物理引擎漏洞,RLHF 中模型可能学会讨好奖励模型。应对办法是反复检查奖励、人工看回放、加约束项。
例子DeepMind 列举的案例:要机械臂把红积木叠到蓝积木上,奖励按红积木底面的高度算,机械臂就学会直接把红积木翻个面;另一个仿真机械手学会挡在相机和物体之间,看起来像抓住了物体。
- 也叫
- 奖励投机、Reward Exploitation、规格博弈、Specification Gaming、奖励作弊
- 相关
- 奖励工程、奖励塑形、奖励模型、基于人类反馈的强化学习、安全强化学习
- 来源
- Concrete Problems in AI Safety (Amodei et al., 2016)
Google DeepMind: Specification gaming: the flip side of AI ingenuity
Lilian Weng: Reward Hacking in Reinforcement Learning