具身智能新手名词表English

专用策略

Specialist Policy常用

只针对单一机器人、单一任务或单一场景训练的策略,与通用策略相对。

为某个具体机器人、具体任务甚至具体环境单独采数据、从头训练的控制策略。过去机器人学习基本都这样做:换一台机器人或一个任务,就重新采数据、重新训一个模型。它在自己的任务上往往表现不错、所需数据也少,但难以迁移。Open X-Embodiment(2023)的对比显示,在数据少的场景下,用 22 种机器人混合数据训练的 RT-1-X 比各自只用本数据集训练的原方法平均高约 50%。现在常见做法是先预训练通用策略,再用少量本任务数据微调成专用策略。注意「专家策略」在模仿学习里也指提供示范的 expert,含义不同。

例子只用某台 ALOHA 采集的「拧瓶盖」示范从头训练一个 ACT 策略:它在这台机器、这个任务上可用,换成叠衣服或换一台机械臂就得重新采数据、重新训练。

也叫
专才策略、单任务策略、专家策略、Single-task Policy
相关
通用策略(通才策略)、策略、微调、跨本体、RT-X、Open X-Embodiment 数据集
来源
Open X-Embodiment: Robotic Learning Datasets and RT-X Models (project page)
Open X-Embodiment: Robotic Learning Datasets and RT-X Models (arXiv)
Octo: An Open-Source Generalist Robot Policy
信息截至
2023-10

在完整名词表里查看 →