RaC
RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction进阶让人类在失败前接管、先恢复再纠正,以此扩展长程任务数据的方法
卡内基梅隆大学 Zheyuan Hu、Zackory Erickson、Aviral Kumar 等人 2025 年 9 月发布。作者发现,在接触丰富、柔性物体和长程任务上,只堆专家演示,模仿学习成功率会卡住,因为专家数据里几乎没有「出错后怎么办」。RaC 在模仿学习预训练后加一个人在回路微调阶段:策略执行时,操作员在即将失败时接管,先把机器人退回熟悉的分布内状态(恢复),再示范完成当前子任务(纠正),随即结束该回合。在挂衬衫、密封保鲜盒盖、打包外卖盒三个真机双臂任务和一个仿真装配任务上,它用约十分之一的采集时间和样本超过此前最好方法,成功率还随策略执行的恢复动作次数线性提升。
例子比如挂衬衫时策略快要把衣架挂歪,操作员接管,先把手臂退回正常拿衣架的姿态,再示范一次挂好,这段干预数据加入微调。
- 也叫
- Recovery and Correction
- 相关
- 纠偏数据、人在回路、干预数据、长程任务、复合误差、HIL-SERL
- 来源
- RaC (arXiv 2509.07953)
RaC project page - 信息截至
- 2025-09