返回 大语言模型 思维导图
中文·English
大语言模型ID: ssm-hybrid

SSM/线性注意力混合

SSM & Hybrid Architectures
🎯核心定义
SSM (State Space Model, 状态空间模型) 用线性递推建模序列:ht=Aht1+Bxth_t = A h_{t-1} + B x_t,输出 yt=Chty_t = C h_t,状态大小固定、与序列长度无关;Mamba 在此基础上加入输入依赖的选择性扫描(用 Δt\Delta_t 控制写入与遗忘),计算复杂度 O(n)O(n);线性注意力(RWKV)把 QKTQ K^T 换成核化形式,等价退化成常数大小的状态递推;混合架构(如 Jamba)把全注意力层与 SSM 层交替堆叠。
💡使用场景
百万级超长上下文与高吞吐推理场景;Jamba-1.5 398B(MoE,激活 52B)支持 256K 上下文,2026 年混合架构是长上下文主流路线,面试高频对比 SSM 与 attention 的复杂度与记忆能力。
解决的核心痛点
注意力 O(n2)O(n^2) 的时间/显存随序列平方增长,超长序列不可行;SSM 每 token 显存恒定(状态维度 d×md \times m),训练可用并行扫描;但固定大小的状态难以精确召回历史,纯 SSM 在记忆与检索类任务上偏弱,混合架构用少量注意力层恢复精确检索,以更低算力逼近全注意力质量。
🎯5 个高频面试考点 (Exam Points)
1
SSM 的递推公式是什么?状态如何更新?状态大小固定意味着什么?
2
Mamba 的选择性机制是什么?为什么 B、C、Δt\Delta_t 要输入依赖?
3
Jamba 这类混合架构为什么还要保留注意力层?各自承担什么职责?
4
RWKV/线性注意力的递推形式与标准注意力如何对应?
5
SSM 训练快、推理省的原理是什么?(并行扫描 + 常数状态)
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「SSM/线性注意力混合」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点MLA 低秩 KV 压缩下一个知识点位置编码 RoPE/ALiBi

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA