DrEureka
DrEureka: Language Model Guided Sim-To-Real Transfer进阶让大语言模型自动写奖励函数和域随机化参数,把仿真策略迁移到真机。
DrEureka 是宾夕法尼亚大学、英伟达和得克萨斯大学奥斯汀分校于 2024 年 6 月提出的方法,发表于 RSS 2024,是同团队 Eureka(用大语言模型写奖励函数)的延伸。把仿真里训好的策略搬到真机,通常要人手反复调奖励函数和域随机化范围(训练时随机改摩擦、质量等物理参数,让策略扛得住真实世界的偏差)。DrEureka 分三步自动化:先让大语言模型生成带安全约束的奖励函数并在仿真中训练策略;再在不同物理参数下测试该策略,得出它仍能正常工作的参数范围(奖励感知物理先验,RAPP);最后让大语言模型在这个范围内写出域随机化配置,训练最终策略后直接部署。仿真器用 Isaac Gym,策略只用本体感知输入。
例子在宇树 Go1 四足机器人上,DrEureka 训练出的策略能让机器狗站在瑜伽球上保持平衡并行走,训练过程无需人工反复调参;在四足前进行走和灵巧手转方块任务上,表现与人工设计的方案相当或更好。
- 相关
- Eureka、仿真到现实迁移、域随机化、奖励函数、奖励工程、大语言模型
- 来源
- DrEureka: Language Model Guided Sim-To-Real Transfer (arXiv 2406.01967)
DrEureka 项目主页
DrEureka 代码仓库(GitHub) - 信息截至
- 2024-06