Prismatic VLM
Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models进阶斯坦福与丰田研究院系统比较 VLM 设计的研究和开源模型,OpenVLA 的底座。
Prismatic VLM 出自斯坦福大学和丰田研究院(TRI)的论文,Siddharth Karamcheti 等人发表于 ICML 2024。作者搭了统一的训练与评测框架(12 个基准,覆盖视觉问答、物体定位和挑战集),逐项比较视觉语言模型的设计选择:用哪个视觉编码器、要不要先单独做对齐预训练、语言模型用基座版还是指令微调版等。主要结论:跳过单独的对齐阶段、只做单阶段训练,效果不差还省 20%–25% 算力;把 DINOv2 和 SigLIP 的特征拼起来,定位类任务提升明显;指令微调版语言模型没有显著优势。据此训出的 7B–13B 模型超过同期的 InstructBLIP 和 LLaVA v1.5,代码和几十个检查点都已开源。它和具身智能的关系在于 OpenVLA 直接以 Prismatic-7B 为底座,OpenVLA 论文认为这种融合视觉编码器有助于空间推理。
例子OpenVLA 的底座 Prismatic-7B 由约 6 亿参数的 DINOv2 + SigLIP 融合视觉编码器、2 层 MLP 投影层和 Llama 2 7B 语言模型组成。
- 也叫
- Prismatic VLMs、Prismatic-7B
- 相关
- OpenVLA、视觉语言模型、DINOv2、SigLIP、投影层、Llama
- 来源
- Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models (arXiv 2402.07865)
TRI-ML/prismatic-vlms (GitHub)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246) - 信息截至
- 2024-07