具身智能新手名词表English

梯度阻断

Stop-Gradient进阶

前向照常计算,反向传播时不让梯度从某个量往回传。

梯度阻断是深度学习里的一个基本操作:某个量在前向计算中照常使用,但反向传播时被当作常数,梯度不经过它流向更早的参数。论文里常写作 sg(·),PyTorch 里用 .detach(),JAX 里用 jax.lax.stop_gradient。它用途很多:强化学习里阻断目标值的梯度来稳定时序差分学习;VQ-VAE 用它让码本和编码器分开更新;SimSiam 发现它是自监督学习中防止表征坍缩的关键。在 VLA 中,Physical Intelligence 2025 年的知识隔离阻断了动作专家流向 VLM 骨干的梯度,让新初始化的动作专家不破坏预训练知识,骨干改从离散化动作 token 学习。注意它和限制梯度大小的梯度裁剪不是一回事。

例子知识隔离训练中,连续动作专家读取 VLM 骨干的特征来生成动作,但它的损失不回传到骨干;骨干只通过离散化动作 token 的下一个 token 预测损失来适应机器人数据。

也叫
停止梯度、stop-grad、detach、梯度截断、sg(·)
相关
知识隔离、目标网络、表征坍缩、冻结骨干网络、反向传播、向量量化变分自编码器
来源
Chen & He 2020: Exploring Simple Siamese Representation Learning (SimSiam)
Driess et al. 2025: Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
信息截至
2025-05

在完整名词表里查看 →