奖励模型
Reward ModelRM常用训练出来的打分网络,给一段行为或结果打出「做得好不好」的奖励分。
奖励模型是一个经过训练的神经网络:输入一段行为(机器人轨迹视频、大模型的一个回答等),输出一个奖励分,用来代替人手写的奖励函数。代表性工作是 Christiano 等人 2017 年用人类对两段轨迹的偏好比较来训练奖励模型,只花约一小时人工反馈就教会模拟机器人新动作;OpenAI 2022 年的 InstructGPT 把它放进 RLHF(基于人类反馈的强化学习)流程,成为大模型后训练的标准一步。机器人里很多任务难以写出精确奖励(比如「衣服叠整齐没有」),奖励模型让强化学习、失败检测、数据筛选有了可用信号。常见形式有成功检测器、进度奖励模型、直接让 VLM 打分;风险是策略会钻模型的漏洞,即奖励黑客。
例子Robometer(RSS 2026)在 100 多万条、包含大量失败和次优轨迹的数据集 RBM-1M 上训练,同时学「每一帧的任务进度」和「同一任务两条轨迹哪条更好」,得到可跨多种机器人使用的通用奖励模型。
- 也叫
- 学习式奖励、Learned Reward Model、奖励打分模型
- 相关
- 奖励函数、基于人类反馈的强化学习、进度奖励模型、成功检测器、VLM 作奖励模型、奖励黑客
- 来源
- Deep reinforcement learning from human preferences (Christiano et al., arXiv 1706.03741)
Training language models to follow instructions with human feedback (InstructGPT, arXiv 2203.02155)
Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons (arXiv 2603.02115) - 信息截至
- 2026-05