跳到主内容
智客 ZICQ

智客百科 技术术语

Mamba(状态空间模型)

技术术语
别名: 状态空间模型 SSM ·2026-09-14

Mamba(状态空间模型)

Mamba 是 2023 年提出的新一代序列建模架构,用选择性状态空间(Selective State Space Model)替代 自注意力。核心论文 Mamba: Linear-Time Sequence Modeling with Selective State Spaces。

为什么是 Transformer 的挑战者

  • 线性复杂度:O(n) 而非 O(n²),长序列速度和显存都线性增长。
  • 没有 KV cache:状态压缩到一个固定大小的向量,不随序列变长。
  • 推理更快:在百万级 token 任务上比 Transformer 快 5x。

工作原理(简化)

把序列建模为连续微分方程的离散化版本:

h_t = A·h_{t-1} + B·x_t
y_t = C·h_t

其中 A、B、C 是学习到的矩阵。关键是 Mamba 让 B 和 C 依赖输入("selective"), 这样模型可以根据当前内容决定记住什么、遗忘什么。

限制

  • In-context learning 比 Transformer 弱:同等规模下 few-shot 表现差。
  • 生态:相比 Transformer 还不成熟,训练框架、HuggingFace 集成、H100 优化 都在追赶。
  • 记忆能力:理论上对超长历史压缩会丢细节。

混合架构

最近的模型(Mamba-2、Zamba、Jamba)开始把 SSM 和 attention 混合:

  • 短距离用 attention(精确回忆)。
  • 长距离用 SSM(高效压缩)。

进一步阅读