具身智能新手名词表English

GVL(生成式价值学习)

Generative Value Learning (Vision Language Models are In-Context Value Learners)GVL进阶

让视觉语言模型给打乱顺序的视频帧估计任务进度,当通用价值函数用

Google DeepMind 联合宾夕法尼亚大学、斯坦福在 2024 年 11 月提出,发表于 ICLR 2025。这里的「价值」指任务完成了百分之多少,可用来判断成败、筛选数据、给强化学习当奖励。直接让视觉语言模型(VLM)按时间顺序给每帧打分效果很差,因为相邻帧高度相关,模型容易只按先后给出单调上升的分数。GVL 先把视频帧打乱,再让模型(论文用 Gemini-1.5-Pro)逐帧估计完成度,逼它真正看画面内容。它不需要针对任务训练,在 300 多个真实任务上零样本或少样本可用,还能把人类视频、其他机器人的示例放进上下文来学习。

例子用 GVL 给一批示范视频打进度分,预测进度与真实时间顺序相关性低的片段(多为失败或低质量示范)可被筛掉,再用剩下的数据训练模仿学习策略。

也叫
生成式价值学习
相关
进度奖励模型、VLM 作奖励模型、价值函数、成功检测器、上下文学习、数据筛选
来源
Vision Language Models are In-Context Value Learners (arXiv:2411.04549)
Generative Value Learning 项目主页
信息截至
2025-01

在完整名词表里查看 →