返回 大语言模型 思维导图
中文·English
大语言模型ID: attention-scaled-dot

缩放点积注意力

Scaled Dot-Product Attention
🎯核心定义
Scaled Dot-Product Attention (缩放点积注意力) 是 Transformer 的注意力核心算子,计算 Attention(Q,K,V)=softmax(QKTdk)VAttention(Q,K,V) = softmax(\frac{Q K^T}{\sqrt{d_k}}) V。除以 dk\sqrt{d_k} 用于归一化点积方差:当 Q、K 各分量方差为 1 时,dkd_k 维点积的方差与 dkd_k 成正比,若不缩放,softmax 输入随维度膨胀进入饱和区(如 dk=128d_k = 12812811.3\sqrt{128} \approx 11.3),梯度趋近 0。
💡使用场景
每个注意力头对序列内所有 token 做软匹配,是 MHA/GQA/MLA、FlashAttention、RoPE 等一切注意力话题的基础;面试常从"为什么除以 dk\sqrt{d_k}"切入,再追问复杂度、mask 与多头拆分。
解决的核心痛点
相比不缩放的点积,缩放保证任意维度下 softmax 的熵与梯度稳定,深层网络可训练;但时间与显存仍是 O(n2)O(n^2),长序列下成为主要瓶颈,需要 FlashAttention 等 IO 优化来缓解。
🎯5 个高频面试考点 (Exam Points)
1
为什么注意力要除以 dk\sqrt{d_k}?不除以会怎样(方差分析与 softmax 饱和)?
2
缩放点积注意力的时间与空间复杂度是多少?为什么 O(n2)O(n^2) 是长上下文瓶颈?
3
Q、K、V 的投影矩阵形状是什么?多头如何拆分与拼接?
4
padding mask 与 causal mask 的区别与实现方式?
5
单头 vs 多头:为什么拆成 h 个头而不是一个 dd 维大头?
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「缩放点积注意力」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点KV Cache 管理下一个知识点注意力变体 MHA/MQA/GQA

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据评测基准 MMLU/GSM8K分词 BPE/WordPiece