cuDNN
CUDA Deep Neural Network Library进阶英伟达为深度学习常用算子做的 GPU 加速库。
英伟达提供的深度学习原语加速库,把卷积、池化、归一化、注意力等常用算子(算子即神经网络里的基本计算单元)在各代 GPU 上做了高度优化的实现。PyTorch、TensorFlow 这些框架并不自己写这些底层 kernel,而是调 cuDNN,所以它装得对不对、版本与 CUDA 和驱动是否匹配,直接决定训练能不能跑、跑多快。它不是独立工具,而是随 CUDA 生态一起安装的库;实践中最常遇到的就是环境版本对齐问题,以及卷积算法自动选优导致头几个 batch 偏慢。
例子PyTorch 里打开 torch.backends.cudnn.benchmark,让 cuDNN 为固定输入尺寸挑最快的卷积实现。
- 也叫
- cuDNN
- 相关
- CUDA、PyTorch、TensorRT、算子、GPU 显存、混合精度训练
- 来源
- NVIDIA cuDNN
NVIDIA cuDNN Documentation