具身智能新手名词表English

行为克隆

Behavior CloningBC入门必知

把专家演示当标注数据,用监督学习直接学「看到什么就做什么」。

行为克隆是最基础的模仿学习方法:收集大量「观测-动作」对,比如人遥操作机器人时记录的相机画面和关节指令,把观测当输入、专家动作当标签,用监督学习训练策略网络去拟合。1988 年 Pomerleau 的 ALVINN 用神经网络从图像直接输出行驶方向,是早期代表。它简单稳定,不需要设计奖励函数,ACT、扩散策略和多数 VLA 模型的主体训练都属于行为克隆。主要缺点是复合误差:策略一旦偏离演示轨迹,就进入训练时没见过的状态,小错越积越大;DAgger、纠偏数据和强化学习微调都是针对这一点的补救。

例子ACT 只用约 10 分钟、50 条人类遥操作演示做行为克隆,就让低成本双臂机器人以 80%–90% 的成功率完成打开半透明调料杯盖、往遥控器里装电池等精细任务。

也叫
行为复制、Behavioral Cloning、Behavioural Cloning
相关
模仿学习、复合误差、DAgger(数据集聚合)、演示数据、ACT、扩散策略
来源
Wikipedia: Imitation learning
Pomerleau 1988: ALVINN: An Autonomous Land Vehicle in a Neural Network (NeurIPS)
Zhao et al. 2023: Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)

在完整名词表里查看 →