具身智能新手名词表English

多模态大语言模型

Multimodal Large Language ModelMLLM常用

以大语言模型为核心、能同时理解图像、视频、音频等输入的大模型。

多模态大语言模型指以大语言模型(LLM)为「大脑」、还能接收图像、视频、音频等非文本输入的模型,2023 年 GPT-4V 让这一方向广受关注。Yin 等人的综述把典型结构拆成三块:预训练的模态编码器(如 CLIP、SigLIP 视觉编码器)、预训练的 LLM,以及连接两者的模态接口(MLP 投影层、Q-Former 或插入 LLM 的交叉注意力)。训练通常先做模态对齐预训练,再做指令微调。只处理图像和文字的 MLLM 也常叫视觉语言模型(VLM)。它对具身智能的意义在于带来互联网规模的常识和视觉理解:多数 VLA 就是在 MLLM / VLM 上加动作输出训练出来的,具身推理模型、任务规划器也多由 MLLM 微调而来。

例子LLaVA-1.5 用 CLIP-ViT-L-336px 视觉编码器,通过一个 MLP 投影层接到语言模型上,再用视觉指令数据微调;GPT-4o、Gemini、Qwen2.5-VL 也都属于多模态大语言模型。

也叫
多模态大模型、Multimodal LLM
相关
视觉语言模型、大语言模型、原生多模态、投影层、视觉-语言-动作模型、模态对齐
来源
A Survey on Multimodal Large Language Models (arXiv:2306.13549)
Improved Baselines with Visual Instruction Tuning (LLaVA-1.5, arXiv:2310.03744)

在完整名词表里查看 →