具身智能新手名词表English

RoboMonkey

RoboMonkey: Scaling Test-Time Sampling and Verification for Vision-Language-Action Models进阶

部署时多采样几组动作、再用 VLM 验证器挑最优,提升 VLA 鲁棒性

RoboMonkey 由斯坦福、加州大学伯克利分校和英伟达的研究者在 2025 年 6 月发布,CoRL 2025 录用,把大语言模型里的「推理时扩展」思路搬到 VLA 上。它不改动原策略:部署时先从 VLA 采样若干动作,加高斯扰动并用多数投票构造候选集,再由一个基于视觉语言模型的动作验证器打分,选出最好的一组执行。验证器用自动合成的偏好数据训练(按候选动作与真值动作的距离排序),作者发现合成数据越多验证越准,动作误差与采样数量之间也呈近似幂律关系。配合 OpenVLA 等模型,它在分布外任务上绝对提升 25%,分布内提升 9%;优化后的服务引擎约 650 毫秒即可采样并验证 16 个候选动作。

例子OpenVLA 遇到没见过的物体时,RoboMonkey 让它一次采样多组抓取动作,由验证器挑出最可能成功的那组去执行。

相关
推理时计算、最优 N 采样、价值引导采样、视觉-语言-动作模型、OpenVLA、奖励模型
来源
arXiv 2506.17811: RoboMonkey
RoboMonkey 项目主页
信息截至
2025-07

在完整名词表里查看 →