通用策略(通才策略)
Generalist Policy入门必知一个模型就能执行多种任务、适配多种场景甚至多种机器人的控制策略。
策略是把观测映射成动作的模型。通用策略指用大规模、多任务、常常跨机器人的数据训练出的单个策略,能按语言指令或目标图像完成许多不同任务,在新场景下也有一定泛化能力;与之相对的专用策略只为一个任务或一台机器人训练。它通常先大规模预训练,再用少量目标场景数据微调到具体机器人和任务,思路类似大语言模型。代表作有 2024 年的开源模型 Octo(在 Open X-Embodiment 的 80 万条轨迹上训练,可在消费级显卡上几小时内微调到新机器人)、OpenVLA,以及 Physical Intelligence 的 π0 系列。如今多数 VLA 模型都以通用策略为目标。
例子给 Octo 一句语言指令,或一张任务完成后的目标图像,它都能据此输出机械臂动作,不需要为每个任务单独训练一个模型。
- 也叫
- 通才策略、通用机器人策略、Generalist Robot Policy
- 相关
- 策略、专用策略、Octo、π0、视觉-语言-动作模型、跨本体
- 来源
- Octo: An Open-Source Generalist Robot Policy
π0: A Vision-Language-Action Flow Model for General Robot Control - 信息截至
- 2024-10