Mamba
Mamba (Selective State Space Model)进阶用随输入变化的状态空间模型替代注意力、计算量随序列长度线性增长的序列模型。
Mamba 由卡内基梅隆大学的 Albert Gu 和普林斯顿大学的 Tri Dao 于 2023 年 12 月提出。Transformer 的自注意力计算量随序列长度平方增长,长序列代价很高;状态空间模型(SSM)像循环网络一样用固定大小的隐状态逐步吸收输入,计算量线性增长,但早期 SSM 参数固定,不能按内容决定记住还是忘掉什么。Mamba 让这些参数随当前输入变化(即「选择性」),配合面向 GPU 的并行扫描算法,整个架构不用注意力,也不用单独的 MLP 块。论文报告其推理吞吐量约为 Transformer 的 5 倍,Mamba-3B 的效果与两倍参数的 Transformer 相当;2024 年两人又推出快 2–8 倍的 Mamba-2。机器人领域有 RoboMamba 等工作用它降低 VLA 的推理延迟。
例子RoboMamba 以 Mamba 语言模型为骨干构建 VLA,只微调约 0.1% 的参数就学会操作技能,论文报告其推理速度是当时已有 VLA 模型的 3 倍。
- 也叫
- 选择性状态空间模型、Selective State Space Model、Selective SSM、Mamba-2
- 相关
- 状态空间模型、Transformer、循环神经网络、RoboMamba、推理延迟、上下文长度
- 来源
- Mamba: Linear-Time Sequence Modeling with Selective State Spaces (arXiv:2312.00752)
Transformers are SSMs (Mamba-2, arXiv:2405.21060)
RoboMamba: Efficient Vision-Language-Action Model for Robotic Reasoning and Manipulation (arXiv:2406.04339) - 信息截至
- 2024-05