投影层
Projector / Connector常用把视觉编码器输出的特征映射到语言模型输入空间的小网络。
投影层是多模态模型里连接两个预训练模块的小网络,最常见的用途是把视觉编码器输出的图像特征,映射成大语言模型能直接读入的向量。之所以需要它,是因为两边各自预训练,特征维度和分布都对不上。LLaVA 最初只用一个线性层,LLaVA-1.5 换成两层 MLP(多层感知机)后效果更好;更复杂的做法有 Q-Former、Perceiver 重采样器,它们还会顺带压缩 token 数量。训练 VLM 时常先冻结两端、只训投影层,完成模态对齐。VLA 里同样的思路也用于机器人状态和动作:用线性层或 MLP 把关节角等低维向量投影到模型的嵌入维度。
例子OpenVLA 把 SigLIP 和 DINOv2 两路图像特征按通道拼接,再经一个两层 MLP 投影层送进 Llama 2 7B 语言模型。
- 也叫
- 连接器、适配层、模态投影器、Projector、Connector、Vision-Language Connector
- 相关
- 视觉编码器、多模态融合、Q-Former、Perceiver 重采样器、模态对齐、LLaVA(视觉指令微调架构)
- 来源
- OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)
Improved Baselines with Visual Instruction Tuning (LLaVA-1.5, arXiv 2310.03744)