文本编码器
Text Encoder常用把文字指令转换成向量序列,供模型其他部分使用的网络。
文本编码器把一段文字(如「把杯子放进水槽」)切成 token 后转换成向量,作为策略或生成模型的条件输入。它通常是预训练好的语言模型,训练机器人策略时常冻结不动:Octo 用约 1.1 亿参数的 T5-base,RDT-1B 用冻结的 T5-XXL;CLIP、SigLIP 各带一个与图像对齐的文本编码器;文生图、文生视频模型也靠它读懂提示词。它把预训练得到的语言知识带进策略,帮模型区分不同指令。以大语言模型为骨干的 VLA(如 OpenVLA、π0)不再单设文本编码器,文字直接作为 token 进入语言模型本身。
例子Octo 用冻结的 t5-base 把指令编码成 16 个语言 token,与图像 token 一起送入 Transformer;论文试过换更大的 T5 或微调它,都没有带来提升。
- 也叫
- 语言编码器、Language Encoder、指令编码器
- 相关
- 语言条件策略、CLIP、SigLIP、大语言模型、嵌入向量、FiLM 特征调制
- 来源
- Octo: An Open-Source Generalist Robot Policy (arXiv 2405.12213)
RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation (arXiv 2410.07864)