骨干网络
Backbone Network入门必知模型中负责从原始输入提取通用特征的主体网络,后面再接各种任务头。
骨干网络原是计算机视觉里的说法,例如 2017 年的 Mask R-CNN 论文就把网络分成两部分:对整张图提取特征的卷积骨干(如 ResNet-50),和做分类、边框回归、掩码预测的网络头。骨干通常先在大规模数据上预训练,再被不同任务复用,换一个更强的骨干往往整体提升效果。到了具身模型,骨干多是预训练好的视觉语言模型:OpenVLA 用 Llama 2 加 DINOv2、SigLIP 视觉编码器,π0 用 PaliGemma,GR00T N1 用英伟达 Eagle-2。骨干提供语义知识,动作头或动作专家把特征变成动作;微调时是否冻结骨干,是常见的设计取舍。
例子GR00T N1 的 22 亿参数里有 13.4 亿属于 Eagle-2 视觉语言骨干;它取骨干第 12 层而不是最后一层的特征交给动作模块,论文称这样推理更快,策略成功率也更高。
- 也叫
- 主干网络、Backbone、主干
- 相关
- 视觉编码器、视觉语言模型、动作头、冻结骨干网络、预训练、残差网络
- 来源
- Mask R-CNN (arXiv 1703.06870)
GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (arXiv 2503.14734)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)