随机失活
Dropout常用训练时随机「关掉」一部分神经元,防止网络死记训练数据的正则化方法。
Dropout 出自 Hinton 团队,2014 年 Srivastava、Hinton 等人在 JMLR 发表了系统论文。训练时每一步按设定概率随机把一部分神经元的输出置零,相当于每次都在训练一个不同的「子网络」;测试时关闭丢弃,用完整网络并对权重做相应缩放,近似这些子网络的平均。这样神经元不能过度依赖彼此,从而减轻过拟合(在训练集上表现好、换新数据就变差)。它常和权重衰减、数据增强、早停一起用,Transformer 里常见的丢弃概率是 0.1。机器人演示数据往往只有几十到几百条,容易过拟合,dropout 是常见配置。
例子ACT(Action Chunking with Transformers)官方代码中 Transformer 的 dropout 默认为 0.1;强化学习算法 DroQ 在 Q 网络里加入 dropout 和层归一化,用小集成达到与大集成方法 REDQ 相当的样本效率,计算量却接近 SAC。
- 也叫
- 丢弃法、Dropout 正则化
- 相关
- 正则化、过拟合、早停、数据增强、归一化层(层归一化 / RMSNorm / 批归一化)
- 来源
- Dropout: A Simple Way to Prevent Neural Networks from Overfitting (JMLR 2014)
ACT 官方代码 detr/main.py(--dropout 默认 0.1)
Dropout Q-Functions for Doubly Efficient Reinforcement Learning (DroQ)