多模态融合
Multimodal Fusion常用把图像、语言、本体状态等不同来源的信息合到一起,让模型联合使用。
多模态融合指把不同模态(图像、文字、深度、触觉、关节状态等)的信息整合成模型能共同使用的表示。Baltrušaitis 等人 2017 年的综述把它列为多模态机器学习的五大核心挑战之一,另外四个是表征、翻译、对齐和协同学习。按融合发生的位置,常分为早期融合(一开始就把各模态特征或 token 拼在一起处理)、中间融合(各模态先分别编码,再在网络中间用交叉注意力等方式合并)和晚期融合(各模态各自出结果,最后合并决策)。具身智能天然是多模态的,VLA 要同时看相机画面、读语言指令、感知自身状态,融合方式直接影响模型能否把「拿红色杯子」这样的指令对应到正确的物体和动作上。
例子RT-1 用 FiLM 层把语言指令的嵌入注入 EfficientNet-B3 图像编码器,让视觉特征从网络前段就带上任务信息;π0 则把图像、语言、状态和动作 token 放进同一个 Transformer,靠注意力完成融合。
- 也叫
- 模态融合、早期融合 / 中间融合 / 晚期融合、Early / Late Fusion
- 相关
- 多模态大语言模型、交叉注意力、FiLM 特征调制、投影层、视触觉融合、多传感器融合
- 来源
- Multimodal Machine Learning: A Survey and Taxonomy (arXiv:1705.09406)
Wikipedia: Multimodal learning
RT-1: Robotics Transformer for Real-World Control at Scale (arXiv:2212.06817)