状态空间模型
State Space ModelSSM进阶用一个随时间更新的隐藏状态处理长序列的网络,计算量随序列长度线性增长。
状态空间模型源自控制理论:用一个隐藏状态概括过去,每来一个新输入,就按线性方程更新状态并给出输出。深度学习里的 SSM 把这套方程离散化后当作网络层,参数靠训练学出。2021 年斯坦福的 Gu、Goel、Ré 提出 S4(ICLR 2022),让它首次在上万步的长序列上好用;2023 年 Gu 与 Dao 的 Mamba 让参数随输入变化(称为选择性),能按内容决定记住还是遗忘。和 Transformer 相比,它推理时只需保留固定大小的状态,计算量随序列长度线性增长,而注意力是平方增长,因此适合长历史、高频控制和端侧部署。注意别和强化学习里的「状态空间」(所有可能状态的集合)混淆。
例子Mamba 论文报告推理吞吐比同规模 Transformer 高约 5 倍,3B 参数的 Mamba 语言模型超过同规模 Transformer、与两倍规模的 Transformer 相当;具身领域的 RoboMamba 就用 Mamba 语言模型替代 Transformer 做 VLA 的推理骨干。
- 也叫
- 结构化状态空间模型、S4、选择性状态空间模型、Selective SSM
- 相关
- Mamba、Transformer、循环神经网络、RoboMamba、上下文长度、状态空间
- 来源
- Efficiently Modeling Long Sequences with Structured State Spaces (S4, arXiv:2111.00396)
Mamba: Linear-Time Sequence Modeling with Selective State Spaces (arXiv:2312.00752)