具身智能新手名词表English

RaC

RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction进阶

让人类在失败前接管、先恢复再纠正,以此扩展长程任务数据的方法

卡内基梅隆大学 Zheyuan Hu、Zackory Erickson、Aviral Kumar 等人 2025 年 9 月发布。作者发现,在接触丰富、柔性物体和长程任务上,只堆专家演示,模仿学习成功率会卡住,因为专家数据里几乎没有「出错后怎么办」。RaC 在模仿学习预训练后加一个人在回路微调阶段:策略执行时,操作员在即将失败时接管,先把机器人退回熟悉的分布内状态(恢复),再示范完成当前子任务(纠正),随即结束该回合。在挂衬衫、密封保鲜盒盖、打包外卖盒三个真机双臂任务和一个仿真装配任务上,它用约十分之一的采集时间和样本超过此前最好方法,成功率还随策略执行的恢复动作次数线性提升。

例子比如挂衬衫时策略快要把衣架挂歪,操作员接管,先把手臂退回正常拿衣架的姿态,再示范一次挂好,这段干预数据加入微调。

也叫
Recovery and Correction
相关
纠偏数据、人在回路、干预数据、长程任务、复合误差、HIL-SERL
来源
RaC (arXiv 2509.07953)
RaC project page
信息截至
2025-09

在完整名词表里查看 →