具身智能新手名词表English

价值引导采样

Value-Guided Sampling进阶

先从策略采样多个候选动作,再用价值函数打分,挑最好的执行。

价值引导采样在推理时提升策略:不改原策略权重,每步先从策略采样多个候选动作,再用单独训练的价值函数(Q 函数)打分,选最高分的,或按分数做 softmax 抽样。代表工作是 Levine 组的 V-GPS(CoRL 2024):用 Cal-QL 等离线强化学习在 Bridge 和 RT-1 数据上训练语言条件 Q 函数,给 Octo、OpenVLA 等五种通用策略做重排序,12 个任务上都有提升。通用策略的训练数据质量参差,价值函数负责把「做得好」的动作挑出来。它和最优 N 采样、RoboMonkey 用 VLM 校验动作同属推理时计算。

例子V-GPS 真机实验中,每一步从通用策略采样 50 个候选动作,用 Q 函数挑出得分最高的执行;据论文报告,WidowX 机械臂 6 个任务的平均成功率相对提升 82.8%。

也叫
价值引导策略重排序、价值重排序、Value-Guided Policy Steering
相关
推理时计算、最优 N 采样、V-GPS、Q 函数、离线强化学习、RoboMonkey
来源
Nakamoto et al. 2024: Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance (V-GPS, CoRL 2024)
Kwok et al. 2025: RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models
信息截至
2025-07

在完整名词表里查看 →