具身智能新手名词表English

奖励模型

Reward ModelRM常用

训练出来的打分网络,给一段行为或结果打出「做得好不好」的奖励分。

奖励模型是一个经过训练的神经网络:输入一段行为(机器人轨迹视频、大模型的一个回答等),输出一个奖励分,用来代替人手写的奖励函数。代表性工作是 Christiano 等人 2017 年用人类对两段轨迹的偏好比较来训练奖励模型,只花约一小时人工反馈就教会模拟机器人新动作;OpenAI 2022 年的 InstructGPT 把它放进 RLHF(基于人类反馈的强化学习)流程,成为大模型后训练的标准一步。机器人里很多任务难以写出精确奖励(比如「衣服叠整齐没有」),奖励模型让强化学习、失败检测、数据筛选有了可用信号。常见形式有成功检测器、进度奖励模型、直接让 VLM 打分;风险是策略会钻模型的漏洞,即奖励黑客。

例子Robometer(RSS 2026)在 100 多万条、包含大量失败和次优轨迹的数据集 RBM-1M 上训练,同时学「每一帧的任务进度」和「同一任务两条轨迹哪条更好」,得到可跨多种机器人使用的通用奖励模型。

也叫
学习式奖励、Learned Reward Model、奖励打分模型
相关
奖励函数、基于人类反馈的强化学习、进度奖励模型、成功检测器、VLM 作奖励模型、奖励黑客
来源
Deep reinforcement learning from human preferences (Christiano et al., arXiv 1706.03741)
Training language models to follow instructions with human feedback (InstructGPT, arXiv 2203.02155)
Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons (arXiv 2603.02115)
信息截至
2026-05

在完整名词表里查看 →