TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
FlashAttention
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
flashattention
FlashAttention
🎯
核心定义
FlashAttention 是 IO 感知的精确注意力实现:把
Q
K
T
Q K^T
Q
K
T
分块 (tiling) 放进 SRAM 计算,配合 online softmax 维护运行最大值
m
i
m_i
m
i
与归一化因子
l
i
l_i
l
i
(合并新块时递归缩放:
m
n
e
w
=
m
a
x
(
m
,
m
l
o
c
a
l
)
m_{new} = max(m, m_{local})
m
n
e
w
=
ma
x
(
m
,
m
l
oc
a
l
)
),前向不把
O
(
n
2
)
O(n^2)
O
(
n
2
)
注意力矩阵写回 HBM,反向用重算而非存储;动机是 HBM 与 SRAM 的带宽差距约 10-20 倍(A100: 40GB HBM vs 约 108KB SRAM)。
💡
使用场景
大模型训练与推理的事实标准实现(PyTorch SDPA、NVIDIA FA2/FA3、DeepSeek/Meta 训练栈),序列越长收益越大,长上下文训练几乎必用。
⚡
解决的核心痛点
标准实现把注意力矩阵反复写读 HBM,IO 成为主要瓶颈;分块 + 重算把 HBM 访问从
O
(
n
2
d
)
O(n^2 d)
O
(
n
2
d
)
降到
O
(
n
2
d
2
M
)
O(\frac{n^2 d^2}{M})
O
(
M
n
2
d
2
)
(
M
M
M
为 SRAM 大小),速度提升 2-4 倍、显存从
O
(
n
2
)
O(n^2)
O
(
n
2
)
降到
O
(
n
)
O(n)
O
(
n
)
,且结果与标准 softmax 逐位一致(不是近似)。
🎯
5 个高频面试考点 (Exam Points)
1
为什么说 attention 是 memory-bound?HBM 与 SRAM 的带宽/容量差距?
2
online softmax 如何合并分块统计量?(运行最大值 m 与归一化因子 l 的递归公式)
3
反向传播为什么重算而不存储?显存从
O
(
n
2
)
O(n^2)
O
(
n
2
)
降到多少?
4
FlashAttention-2 相比 v1 改进了什么?(省略中间矩阵、减少非矩阵运算、约 2×)?
5
FlashAttention 为什么是精确的?与稀疏/低秩注意力有什么本质区别?
📖 关联深度指南:
📄 transformer-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「FlashAttention」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
归一化 Pre-LN/RMSNorm
下一个知识点 →
指令微调 SFT
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA