具身智能新手名词表English

动作分块

Action Chunking入门必知

策略一次预测接下来一小段连续动作,而不是每一步只输出一个动作。

动作分块指策略每次推理输出未来 k 步的动作序列(一个「块」),执行完一部分或全部后再重新观测、再预测。这个叫法由 Tony Zhao、Chelsea Finn 等人 2023 年的 ACT 论文带进机器人学习,借自神经科学里「把一串动作打包成一个单元来执行」的概念:ACT 以 50Hz 控制双臂,每次预测未来 100 步的关节目标。它解决两个问题:一是让决策次数缩短为原来的 1/k,减轻行为克隆中小误差逐步累积的复合误差;二是更容易学到人类演示里的停顿这类单步策略难以建模的时序习惯。现在扩散策略、π0(一次 50 步)、GR00T N1(一次 16 步)等主流模型都输出动作块,块与块之间常用时序集成或实时动作分块来衔接,避免动作突变。

例子ACT 在低成本双臂平台 ALOHA 上做了 6 个精细任务,每个任务只用 10–20 分钟(约 50 条)演示:打开半透明调料杯盖成功率 84%,把电池装进遥控器 96%,最难的穿魔术贴扎带只有 20%。它每次输出未来 100 步(50Hz 下约 2 秒)的关节目标。

也叫
动作块、action chunk、chunk、动作序列预测
相关
动作视界、时序集成、实时动作分块、复合误差、ACT、扩散策略
来源
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv 2304.13705)
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv 2410.24164)
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)

在完整名词表里查看 →