SigLIP
Sigmoid Loss for Language-Image Pre-training常用谷歌用 Sigmoid 损失训练的图文模型,其图像编码器被许多 VLA 采用。
SigLIP 是谷歌 Xiaohua Zhai 等人 2023 年提出的图文预训练方法(ICCV 2023)。它和 CLIP 一样训练图像、文本两个编码器,让配对的图文向量靠近;区别在损失函数:CLIP 用 Softmax 在整批样本上归一化,SigLIP 把每对图文单独当作「是否匹配」的二分类,用 Sigmoid 损失,不依赖全批归一化,小批量也训得好、更省显存。它的视觉编码器(如约 4 亿参数的 So400m)是许多 VLM 和 VLA 的图像输入端。2025 年 2 月的 SigLIP 2 加入字幕生成、自蒸馏等训练目标,多语言、定位和稠密特征都有提升。
例子π0 的骨干 PaliGemma 由 SigLIP-So400m 视觉编码器和 Gemma-2B 语言模型组成;OpenVLA 则把 SigLIP 与 DINOv2 的特征拼在一起使用。
- 也叫
- SigLIP 2、SigLIP-So400m、Sigmoid 损失图文预训练
- 相关
- CLIP、对比学习、视觉编码器、PaliGemma、DINOv2、Softmax(归一化指数函数)
- 来源
- Sigmoid Loss for Language Image Pre-Training (arXiv 2303.15343)
SigLIP 2: Multilingual Vision-Language Encoders (arXiv 2502.14786)
PaliGemma: A versatile 3B VLM for transfer (arXiv 2407.07726) - 信息截至
- 2025-02