GRAPE
GRAPE: Generalizing Robot Policy via Preference Alignment进阶用成功和失败轨迹做偏好对齐,提升 VLA 在新任务上泛化的方法。
GRAPE 由北卡罗来纳大学教堂山分校、华盛顿大学、芝加哥大学的研究者 2024 年 11 月提出,实验以 OpenVLA 为基础模型。多数 VLA 只对成功示范做行为克隆(照着示范学),没见过失败,不知道哪些做法要避免,泛化到新任务时容易出错。GRAPE 借鉴大语言模型的偏好对齐思路:让模型自己执行多次,按得分给整条轨迹排出好坏,再用「轨迹级偏好优化」(TPO)让模型偏向好轨迹,失败轨迹也能提供信息。打分时先把复杂任务拆成若干阶段,由视觉语言模型为各阶段生成时空约束作为评分依据;换一套约束,就能按「更安全」「更高效」等不同目标来对齐。
例子作者报告,GRAPE 让训练内任务和未见任务的成功率分别提升 51.79% 和 58.20%;按安全、效率目标对齐时,碰撞率下降 37.44%,执行步数减少 11.15%。
- 也叫
- 偏好对齐机器人策略
- 相关
- 直接偏好优化、视觉-语言-动作模型、OpenVLA、行为克隆、泛化、强化学习微调
- 来源
- GRAPE: Generalizing Robot Policy via Preference Alignment (arXiv 2411.19309)
GRAPE 项目页 - 信息截至
- 2025-02