ACT
Action Chunking with Transformers入门必知斯坦福 2023 年提出的模仿学习策略,一次预测一段动作,让低成本双臂做精细活。
ACT 是斯坦福 Tony Zhao、Chelsea Finn 等人(合作方含 UC Berkeley、Meta)2023 年 4 月提出的模仿学习算法,与低成本双臂平台 ALOHA(硬件预算约 2 万美元)一起发表于 RSS 2023。行为克隆(照着人类演示学动作)每一步的小误差会越积越大,精细任务尤其容易失败。ACT 让 Transformer 一次输出未来一整段动作(动作分块),决策次数变少,误差累积也少;训练时套一层条件变分自编码器(CVAE,能表达同一场景多种做法的生成模型)来吸收人类演示的随机性;执行时用时序集成把重叠的动作块加权平均,让动作更平滑。它结构简单、数据需求小,后来成为 Mobile ALOHA、LeRobot 等项目的常用基线。
例子在 ALOHA 上,ACT 每个任务只用约 10 分钟的遥操作演示,就学会了打开半透明调料杯、把电池插进槽里等 6 个精细任务,成功率 80%–90%。
- 也叫
- 动作分块 Transformer、Action Chunking Transformer
- 相关
- 动作分块、时序集成、条件变分自编码器、ALOHA 双臂平台、Mobile ALOHA、行为克隆
- 来源
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (arXiv 2304.13705)
ALOHA / ACT 项目主页 - 信息截至
- 2023-04