具身智能新手名词表English

进度奖励模型

Progress Reward Model进阶

看当前画面判断任务完成了几成,并把这个进度当作奖励的模型。

进度奖励模型是一类机器人奖励模型:输入任务指令和当前画面(有时加上起始帧或历史帧),输出任务完成进度,通常归一化到 0 到 1。真实操作任务往往只有「成没成」这种稀疏奖励,强化学习很难从中学到东西;进度分数可以当作稠密奖励,让策略每一步都知道离目标近了还是远了,也能用来筛数据、判成败。做法主要有两种:直接让视觉语言模型零样本估计,如谷歌 DeepMind 等提出的 GVL;或在大量轨迹上专门训练,如 2026 年的 Robometer。风险是奖励黑客:策略可能学会让画面「看起来」有进展。

例子GVL 把一条机器人视频的帧顺序打乱后交给 VLM,让它给每帧估计完成百分比,不做任何训练就能在 300 多个真实任务上给出可用的进度值,并用于数据筛选和成功检测。

也叫
进度估计器、任务进度预测、Progress Estimator
相关
奖励模型、稀疏奖励、稠密奖励、成功检测器、GVL(生成式价值学习)、Robometer
来源
Ma et al. 2024: Vision Language Models are In-Context Value Learners (GVL)
Liang et al. 2026: Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons
Ayalew et al. 2024: PROGRESSOR
信息截至
2026-03

在完整名词表里查看 →