嵌入向量
Embedding常用把词、图块、动作等对象表示成一串实数,意思相近的东西向量也相近。
嵌入向量是神经网络内部表示信息的基本单位:把一个词、一个图像块、一帧机器人状态等对象,映射成固定长度的一串实数(比如 1024 维)。它是训练中学出来的,不是人工指定的;训练好后,意思相近的对象在向量空间里距离也近。和 one-hot 编码(每个类别占一维、只有该位为 1)相比,嵌入维度低,还能表达相似关系,word2vec 是早期的著名例子。在具身智能模型里嵌入几乎无处不在:分词器把文字切成 token 后查表得到词嵌入,视觉编码器把每个图块变成视觉 token 的嵌入,投影层再把它们映射到语言模型的维度;机器人状态和带噪动作也要先经过线性层变成嵌入,才能和其他 token 一起送进 Transformer。
例子CLIP 把一张猫的照片和「a photo of a cat」这句话分别编码成嵌入向量,两者的余弦相似度会明显高于这张照片和「a photo of a dog」的相似度。
- 也叫
- 嵌入、embedding、向量表示
- 相关
- token(词元)、分词器、视觉 token、潜在空间、投影层、表征学习
- 来源
- Embeddings | Machine Learning Crash Course (Google for Developers)
Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)