具身智能新手名词表English

模态对齐

Modality Alignment (Alignment Pre-training Stage)常用

把图像等新模态的特征映射到语言模型能读懂的表示空间里。

模态对齐指让图像、语言、机器人状态或动作等不同模态的表示落到一个可以互相对应的空间里。狭义上常指多模态大模型训练的第一阶段「对齐预训练」:以 LLaVA(2023)为例,它冻结 CLIP 视觉编码器和大语言模型,只用约 59.5 万对图文数据训练中间的投影层,让图像特征变成语言模型能处理的视觉 token;第二阶段再把投影层和语言模型一起用指令数据微调。先单独对齐,是为了让随机初始化的投影层先学会产出合理的视觉 token,再放开语言模型。广义上,CLIP 用对比学习把图文嵌入拉进同一空间也算模态对齐。VLA 给视觉语言模型接上状态编码器和动作头时也面临同样的问题。

例子LLaVA 第一阶段在过滤后的 CC3M 子集(59.5 万图文对)上只训练投影矩阵 1 个 epoch,学习率 2e-3;第二阶段冻结视觉编码器,用 15.8 万条多模态指令数据微调投影层和语言模型。

也叫
对齐预训练、特征对齐预训练、跨模态对齐
相关
投影层、视觉语言模型、多模态大语言模型、CLIP、冻结骨干网络、知识隔离
来源
Visual Instruction Tuning (LLaVA, arXiv 2304.08485)

在完整名词表里查看 →