TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
深度学习 思维导图
›
SSM 与 Mamba
← 返回 深度学习 思维导图
中文
·
English
🧠 深度学习
ID:
ssm-mamba
SSM 与 Mamba
SSM & Mamba
🎯
核心定义
状态空间模型(SSM, 如 S4/Mamba)把序列建模写成线性时不变系统: 连续形式
h
˙
(
t
)
=
A
h
(
t
)
+
B
x
(
t
)
\dot{h}(t) = Ah(t) + Bx(t)
h
˙
(
t
)
=
A
h
(
t
)
+
B
x
(
t
)
,
y
(
t
)
=
C
h
(
t
)
y(t) = Ch(t)
y
(
t
)
=
C
h
(
t
)
; 用 ZOH(零阶保持)离散化得
A
ˉ
=
e
A
Δ
\bar{A} = e^{A\Delta}
A
ˉ
=
e
A
Δ
,
B
ˉ
=
(
e
A
Δ
−
I
)
A
−
1
B
\bar{B} = (e^{A\Delta} - I)A^{-1}B
B
ˉ
=
(
e
A
Δ
−
I
)
A
−
1
B
, 于是推理是线性递推
h
t
=
A
ˉ
h
t
−
1
+
B
ˉ
x
t
h_t = \bar{A}h_{t-1} + \bar{B}x_t
h
t
=
A
ˉ
h
t
−
1
+
B
ˉ
x
t
, 输出
y
t
=
C
h
t
y_t = Ch_t
y
t
=
C
h
t
——每步
O
(
1
)
O(1)
O
(
1
)
状态更新, 无 KV 缓存。时不变时(
A
ˉ
,
B
ˉ
,
C
\bar{A}, \bar{B}, C
A
ˉ
,
B
ˉ
,
C
与输入无关)可展开为全局卷积
y
=
K
ˉ
∗
x
y = \bar{K} * x
y
=
K
ˉ
∗
x
(其中
K
ˉ
=
(
C
B
ˉ
,
C
A
ˉ
B
ˉ
,
…
)
\bar{K} = (C\bar{B}, C\bar{A}\bar{B}, \ldots)
K
ˉ
=
(
C
B
ˉ
,
C
A
ˉ
B
ˉ
,
…
)
), 训练可整段并行。Mamba 的关键是
选择性机制
: 让
Δ
t
,
B
t
,
C
t
\Delta_t, B_t, C_t
Δ
t
,
B
t
,
C
t
依赖输入
x
t
x_t
x
t
(如
Δ
t
=
s
o
f
t
p
l
u
s
(
W
Δ
x
t
)
\Delta_t = \mathrm{softplus}(W_\Delta x_t)
Δ
t
=
softplus
(
W
Δ
x
t
)
), 类似门控, 能按内容决定“记住”还是“忽略”——代价是失去卷积形式, 改用并行扫描(associative scan)训练。复杂度: 自注意力
O
(
L
2
)
O(L^2)
O
(
L
2
)
(时间与显存), Mamba
O
(
L
)
O(L)
O
(
L
)
(序列长度线性), 长序列下显存与速度优势显著。
💡
使用场景
长上下文建模(50k+ token)、边缘设备上的线性时间推理; 面试对比题高频出现: Mamba vs Transformer(复杂度、并行性、长程依赖)、Mamba vs LSTM(选择性 vs 门控)、SSM 离散化推导。
⚡
解决的核心痛点
Transformer 的
O
(
L
2
)
O(L^2)
O
(
L
2
)
注意力随序列长度平方增长, 长上下文训练/推理昂贵; RNN(LSTM)虽
O
(
L
)
O(L)
O
(
L
)
但串行无法并行训练。Mamba 用线性递推保持
O
(
L
)
O(L)
O
(
L
)
复杂度, 又借并行扫描实现训练并行化, 以选择性机制弥补“固定参数递推”表达力不足——在与同规模 Transformer 相当的质量下, 推理吞吐与长序列显存占用都大幅改善。
🎯
5 个高频面试考点 (Exam Points)
1
写出 SSM 离散化递推
h
t
=
A
ˉ
h
t
−
1
+
B
ˉ
x
t
h_t = \bar{A}h_{t-1} + \bar{B}x_t
h
t
=
A
ˉ
h
t
−
1
+
B
ˉ
x
t
并推导连续→离散(
A
ˉ
=
e
A
Δ
\bar{A} = e^{A\Delta}
A
ˉ
=
e
A
Δ
的 ZOH 推导),
Δ
\Delta
Δ
起什么作用?
2
训练并行化: 时不变 SSM 为什么等价于全局卷积
y
=
K
ˉ
∗
x
y = \bar{K} * x
y
=
K
ˉ
∗
x
? 引入选择性后如何用并行扫描(associative scan)恢复并行训练?
3
选择性机制是什么:
Δ
t
,
B
t
,
C
t
\Delta_t, B_t, C_t
Δ
t
,
B
t
,
C
t
为什么必须依赖输入
x
t
x_t
x
t
? 它与 LSTM 门控的异同(内容感知 vs 固定参数)?
4
复杂度对比: 自注意力
O
(
L
2
)
O(L^2)
O
(
L
2
)
的时间与显存 vs Mamba 的
O
(
L
)
O(L)
O
(
L
)
; 在
L
=
100
k
L = 100k
L
=
100
k
长上下文下分别意味着什么?
5
为什么流行的是 Transformer + Mamba 混合架构(每几层插入 Mamba 块)? 纯 Mamba 的潜在弱点是什么?
📖 关联深度指南:
📄 rnn-lstm-and-mamba-ssm →
更新于 2026-08-12
🎯
检验攻克程度:针对「SSM 与 Mamba」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
GRU
下一个知识点 →
SGD 与动量
🔗 更多 深度学习 知识点卡片
激活函数演进
Adam/AdamW
Autograd 动态图
BatchNorm 批归一化