Mamba(状态空间模型)
Mamba 是 2023 年提出的新一代序列建模架构,用选择性状态空间(Selective State Space Model)替代 自注意力。核心论文 Mamba: Linear-Time Sequence Modeling with Selective State Spaces。
为什么是 Transformer 的挑战者
- 线性复杂度:O(n) 而非 O(n²),长序列速度和显存都线性增长。
- 没有 KV cache:状态压缩到一个固定大小的向量,不随序列变长。
- 推理更快:在百万级 token 任务上比 Transformer 快 5x。
工作原理(简化)
把序列建模为连续微分方程的离散化版本:
h_t = A·h_{t-1} + B·x_t
y_t = C·h_t
其中 A、B、C 是学习到的矩阵。关键是 Mamba 让 B 和 C 依赖输入("selective"), 这样模型可以根据当前内容决定记住什么、遗忘什么。
限制
- In-context learning 比 Transformer 弱:同等规模下 few-shot 表现差。
- 生态:相比 Transformer 还不成熟,训练框架、HuggingFace 集成、H100 优化 都在追赶。
- 记忆能力:理论上对超长历史压缩会丢细节。
混合架构
最近的模型(Mamba-2、Zamba、Jamba)开始把 SSM 和 attention 混合:
- 短距离用 attention(精确回忆)。
- 长距离用 SSM(高效压缩)。