混合 Transformer 架构
Mixture-of-TransformersMoT进阶不同模态各用一套 Transformer 参数,但每层通过全局自注意力互相看见。
混合 Transformer 架构由斯坦福的 Weixin Liang 与 Meta 研究者在 2024 年 11 月提出。它把前馈网络、注意力投影矩阵、层归一化等参数按模态分开:文本 token 用文本那套权重,图像 token 用图像那套,但每层的自注意力仍在整条序列上计算,各模态照常交互。与混合专家模型(MoE,由路由器给每个 token 挑专家)不同,MoT 按模态固定分工,不用学路由。论文报告在 7B 规模的文本加图像生成设置中,它只用约 55.8% 的计算量就追平稠密模型。具身领域 π0 的「VLM 主干 + 动作专家」是类似做法(论文称其类似两个成员的混合专家),字节 BAGEL 则直接采用 MoT 结构。
例子π0 的约 30 亿参数主干来自 PaliGemma,另加约 3 亿参数的动作专家:图像和文字 token 走主干权重,机器人状态和带噪动作 token 走动作专家权重,两部分在每层注意力里互相可见。
- 也叫
- Transformer 混合架构、Mixture-of-Transformer-Experts
- 相关
- 混合专家模型、动作专家、π0、BAGEL、统一多模态模型、自注意力
- 来源
- Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models (arXiv:2411.04996)
π0: A Vision-Language-Action Flow Model for General Robot Control (arXiv:2410.24164)
Emerging Properties in Unified Multimodal Pretraining (BAGEL, arXiv:2505.14683) - 信息截至
- 2025-05