Language to Rewards(L2R)
Language to Rewards for Robotic Skill SynthesisL2R进阶让大语言模型把人话翻译成奖励函数,再交给实时优化器生成机器人动作。
Language to Rewards 是 Google DeepMind 2023 年 6 月发布的工作,CoRL 2023 口头报告。让大模型直接出动作或调用预设技能,很难做出「站起来」「太空步」这类底层动作。L2R 改让大模型写奖励函数:奖励翻译器先把指令展开成动作描述,再写成奖励代码(各项目标及权重);运动控制器用 MuJoCo MPC(基于模型预测控制的实时优化器)按奖励求解动作,并随用户追加的纠正实时重规划。在模拟四足机器人和灵巧机械手的 17 个任务上它完成了 90%,基于预设技能原语的基线为 50%;在真实机械臂上也演示了推动物体。它和 Eureka 同属「让大模型写奖励」的路线。
例子用户让模拟四足机器人「像跳太空步一样后退」,看效果后再补几句纠正,几轮对话后机器人学会了太空步。
- 也叫
- Language to Rewards、语言到奖励
- 相关
- 奖励函数、模型预测控制、大语言模型、代码即策略、Eureka、MuJoCo
- 来源
- Language to Rewards for Robotic Skill Synthesis (arXiv 2306.08647)
Language to Rewards 项目页 - 信息截至
- 2023-11