进度奖励模型
Progress Reward Model进阶看当前画面判断任务完成了几成,并把这个进度当作奖励的模型。
进度奖励模型是一类机器人奖励模型:输入任务指令和当前画面(有时加上起始帧或历史帧),输出任务完成进度,通常归一化到 0 到 1。真实操作任务往往只有「成没成」这种稀疏奖励,强化学习很难从中学到东西;进度分数可以当作稠密奖励,让策略每一步都知道离目标近了还是远了,也能用来筛数据、判成败。做法主要有两种:直接让视觉语言模型零样本估计,如谷歌 DeepMind 等提出的 GVL;或在大量轨迹上专门训练,如 2026 年的 Robometer。风险是奖励黑客:策略可能学会让画面「看起来」有进展。
例子GVL 把一条机器人视频的帧顺序打乱后交给 VLM,让它给每帧估计完成百分比,不做任何训练就能在 300 多个真实任务上给出可用的进度值,并用于数据筛选和成功检测。
- 也叫
- 进度估计器、任务进度预测、Progress Estimator
- 相关
- 奖励模型、稀疏奖励、稠密奖励、成功检测器、GVL(生成式价值学习)、Robometer
- 来源
- Ma et al. 2024: Vision Language Models are In-Context Value Learners (GVL)
Liang et al. 2026: Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons
Ayalew et al. 2024: PROGRESSOR - 信息截至
- 2026-03