具身智能新手名词表English

条件变分自编码器

Conditional Variational AutoencoderCVAE常用

给定条件时学习输出分布的 VAE,同一输入能生成多种合理结果。

条件变分自编码器是变分自编码器(VAE)的扩展:编码器和解码器都额外接收一个条件(如当前观测),学的是「给定条件时输出的分布」,而不是单一答案。它由 Sohn、Lee、Yan 在 NeurIPS 2015 提出,最初用于图像分割这类结构化输出预测。训练时编码器看到真实输出,把它的「风格」压成隐变量 z,解码器根据条件和 z 重建输出;推理时改从先验里取 z。模仿学习用它应对演示的多样性:同一场景下人可能走不同轨迹,普通回归会把几种做法平均成一个错误动作。ACT(2023)的做法是:编码器输入关节位置和目标动作序列得到 z,测试时丢掉编码器,把 z 设为先验均值 0。

例子ACT 用 CVAE 一次预测 100 步的动作块,只用约 10 分钟演示数据,就在低成本双臂上完成精细任务,成功率 80%–90%。

也叫
条件 VAE、Conditional VAE
相关
变分自编码器、ACT、动作多峰性、动作分块、生成模型、自编码器
来源
Learning Structured Output Representation using Deep Conditional Generative Models (NeurIPS 2015)
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT, arXiv:2304.13705)

在完整名词表里查看 →