具身智能新手名词表English

Language to Rewards(L2R)

Language to Rewards for Robotic Skill SynthesisL2R进阶

让大语言模型把人话翻译成奖励函数,再交给实时优化器生成机器人动作。

Language to Rewards 是 Google DeepMind 2023 年 6 月发布的工作,CoRL 2023 口头报告。让大模型直接出动作或调用预设技能,很难做出「站起来」「太空步」这类底层动作。L2R 改让大模型写奖励函数:奖励翻译器先把指令展开成动作描述,再写成奖励代码(各项目标及权重);运动控制器用 MuJoCo MPC(基于模型预测控制的实时优化器)按奖励求解动作,并随用户追加的纠正实时重规划。在模拟四足机器人和灵巧机械手的 17 个任务上它完成了 90%,基于预设技能原语的基线为 50%;在真实机械臂上也演示了推动物体。它和 Eureka 同属「让大模型写奖励」的路线。

例子用户让模拟四足机器人「像跳太空步一样后退」,看效果后再补几句纠正,几轮对话后机器人学会了太空步。

也叫
Language to Rewards、语言到奖励
相关
奖励函数、模型预测控制、大语言模型、代码即策略、Eureka、MuJoCo
来源
Language to Rewards for Robotic Skill Synthesis (arXiv 2306.08647)
Language to Rewards 项目页
信息截至
2023-11

在完整名词表里查看 →