TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
SSM/线性注意力混合
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
ssm-hybrid
SSM/线性注意力混合
SSM & Hybrid Architectures
🎯
核心定义
SSM (State Space Model, 状态空间模型) 用线性递推建模序列:
h
t
=
A
h
t
−
1
+
B
x
t
h_t = A h_{t-1} + B x_t
h
t
=
A
h
t
−
1
+
B
x
t
,输出
y
t
=
C
h
t
y_t = C h_t
y
t
=
C
h
t
,状态大小固定、与序列长度无关;Mamba 在此基础上加入输入依赖的选择性扫描(用
Δ
t
\Delta_t
Δ
t
控制写入与遗忘),计算复杂度
O
(
n
)
O(n)
O
(
n
)
;线性注意力(RWKV)把
Q
K
T
Q K^T
Q
K
T
换成核化形式,等价退化成常数大小的状态递推;混合架构(如 Jamba)把全注意力层与 SSM 层交替堆叠。
💡
使用场景
百万级超长上下文与高吞吐推理场景;Jamba-1.5 398B(MoE,激活 52B)支持 256K 上下文,2026 年混合架构是长上下文主流路线,面试高频对比 SSM 与 attention 的复杂度与记忆能力。
⚡
解决的核心痛点
注意力
O
(
n
2
)
O(n^2)
O
(
n
2
)
的时间/显存随序列平方增长,超长序列不可行;SSM 每 token 显存恒定(状态维度
d
×
m
d \times m
d
×
m
),训练可用并行扫描;但固定大小的状态难以精确召回历史,纯 SSM 在记忆与检索类任务上偏弱,混合架构用少量注意力层恢复精确检索,以更低算力逼近全注意力质量。
🎯
5 个高频面试考点 (Exam Points)
1
SSM 的递推公式是什么?状态如何更新?状态大小固定意味着什么?
2
Mamba 的选择性机制是什么?为什么 B、C、
Δ
t
\Delta_t
Δ
t
要输入依赖?
3
Jamba 这类混合架构为什么还要保留注意力层?各自承担什么职责?
4
RWKV/线性注意力的递推形式与标准注意力如何对应?
5
SSM 训练快、推理省的原理是什么?(并行扫描 + 常数状态)
📖 关联深度指南:
📄 transformer-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「SSM/线性注意力混合」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
MLA 低秩 KV 压缩
下一个知识点 →
位置编码 RoPE/ALiBi
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA