冻结骨干网络
Backbone Freezing常用训练时固定预训练骨干网络的参数不更新,只训练新加上去的部分。
骨干网络指模型中负责提取特征的主体,通常来自预训练,如 ResNet、ViT 或整个 VLM。冻结就是训练时不更新这些参数(PyTorch 里把 requires_grad 设为 False),只训练新加的输出头或动作专家。好处是省显存、训练快、数据少时不易过拟合,也能减少灾难性遗忘;代价是骨干学不到新任务需要的特征。VLA 里的取舍很具体:OpenVLA 发现冻结视觉编码器会丢失精细空间信息、控制变差;英伟达 GR00T N1 则在预训练和后训练中都冻结了 VLM 的语言部分,只训练其余模块。
例子PyTorch 官方迁移学习教程中,用 ImageNet 预训练的 ResNet-18 做蚂蚁/蜜蜂分类:冻结除最后一层外的所有层,只训练新换上的全连接层。
- 也叫
- 冻结主干、freeze backbone、冻结预训练层
- 相关
- 骨干网络、微调、参数高效微调、灾难性遗忘、知识隔离、梯度阻断
- 来源
- PyTorch Tutorial: Transfer Learning for Computer Vision
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734) - 信息截至
- 2025-03