具身智能新手名词表English

HIL-SERL

Human-in-the-Loop Sample-Efficient Robotic Reinforcement Learning (Precise and Dexterous Robotic Manipulation via Human-in-the-Loop RL)常用

伯克利的真机强化学习系统,人随时接管纠正,1 到 2.5 小时练成精细操作。

HIL-SERL 是 UC Berkeley 的 Jianlan Luo、Charles Xu、Jeffrey Wu 和 Sergey Levine 提出的真机视觉强化学习系统,2024 年 10 月上线 arXiv,2025 年 8 月登上 Science Robotics 封面。它建立在同组开源的 SERL 软件栈上:先遥操作采一些成功和失败样本,训练一个二分类奖励判别器当稀疏奖励;再采少量演示放进回放池;在线训练用基于 RLPD 的异策略算法(能反复利用旧数据),操作员可随时用 SpaceMouse 等设备接管纠正,纠正数据也拿来学。真机强化学习通常太慢、太不稳定,HIL-SERL 靠预训练视觉骨干、演示加人工纠正和安全的底层控制器,把训练缩短到 1 到 2.5 小时,多数任务成功率接近 100%,平均比模仿学习基线高约 2 倍、执行快 1.8 倍。

例子论文任务包括抽叠叠乐(机械臂甩鞭子把一块积木从塔里抽出)、在锅里给物体翻面,以及装配主板、宜家搁架、汽车仪表盘和同步带等精密装配。

也叫
人在回路样本高效机器人强化学习
相关
SERL、人在回路、真机强化学习、人工门控 DAgger、奖励模型、强化学习微调
来源
Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning (arXiv 2410.21845)
HIL-SERL 项目主页
Jianlan Luo 个人主页(HIL-SERL 发表于 Science Robotics 2025)
信息截至
2025-08

在完整名词表里查看 →