视觉语言模型
Vision-Language ModelVLM入门必知能同时看图和读文字、再用文字作答的模型,是多数 VLA 的底座。
视觉语言模型接收图像和文本、输出文本,能描述图片、回答关于图片的问题、指出物体位置。常见结构有三部分:视觉编码器把图像变成特征,投影层把特征对齐到语言模型的输入空间,语言模型负责理解和生成文字。2023 年的 LLaVA 就是 CLIP 编码器加投影层加 Vicuna 语言模型;谷歌 2024 年开源的 PaliGemma 由 SigLIP 编码器和 Gemma-2B 组成,约 30 亿参数。VLM 从互联网图文里学到的物体、常识和空间知识正是机器人缺的,所以大多数 VLA 从 VLM 出发:RT-2 在 PaLI-X、PaLM-E 上加入机器人数据联合微调,π0 以 PaliGemma 为底座。VLM 也常单独用作分层架构的高层规划器。
例子给 VLM 一张厨房照片问「水槽左边有什么」,它用文字回答;把输出换成动作 token、再用机器人数据训练,就得到 RT-2 这类 VLA。
- 也叫
- 视觉语言大模型、视觉-语言模型、图文大模型
- 相关
- 视觉-语言-动作模型、视觉编码器、投影层、大语言模型、PaliGemma、多模态大语言模型
- 来源
- Vision Language Models Explained (Hugging Face blog)
PaliGemma: A versatile 3B VLM for transfer (arXiv:2407.07726)
RT-2: Vision-Language-Action Models (project page) - 信息截至
- 2024-07