表征坍缩
Representation Collapse进阶自监督训练时编码器对所有输入都输出相同或相近的向量,表征失去信息。
表征坍缩是自监督学习和联合嵌入预测类模型里的典型失败。如果训练目标只要求同一样本两个视角(或当前与未来)的表征彼此接近,编码器最省事的解就是对任何输入都输出同一个常向量:损失很小,表征却不含任何信息。较轻的形式叫维度坍缩,向量只用上了少数几个维度。防坍缩的办法大致三类:对比学习用负样本把不同图片的表征推开;VICReg(Bardes、Ponce、LeCun,2021)显式约束每一维的方差和维度间的协方差;BYOL、JEPA 系列用停止梯度加指数移动平均(EMA)目标编码器。具身智能里,用 JEPA 式隐空间训练视频表征或世界模型时,例如 Meta 的 V-JEPA 2,同样要处理这个问题。
例子V-JEPA 2 训练时,被遮挡视频片段的目标表征由编码器权重的 EMA 副本计算并施加停止梯度,论文说明这样做正是为了防止表征坍缩。
- 也叫
- 表示坍缩、表征崩溃、维度坍缩
- 相关
- 自监督学习、联合嵌入预测架构、对比学习、梯度阻断、指数移动平均、V-JEPA 2
- 来源
- VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning (arXiv 2105.04906)
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv 2506.09985) - 信息截至
- 2025-06