返回 大语言模型 思维导图
中文·English
大语言模型ID: attention-variants

注意力变体 MHA/MQA/GQA

Attention Variants MHA/MQA/GQA
🎯核心定义
MHA (Multi-Head Attention) 每个头独立投影 K/V;MQA (Multi-Query Attention) 所有头共享同一组 K/V(即只有 1 个 KV 头);GQA (Grouped-Query Attention) 把 HH 个查询头分成 GG 组、组内共享 K/V,是两者的折中:LLaMA-2/3 70B 用 8 个 KV 头,LLaMA-2 7B 用 MQA,Mistral/Gemma/Qwen 普遍用 GQA。
💡使用场景
推理时 KV cache 显存受限的所有自回归服务场景;2023 年后 GQA 成为大模型事实标准(LLaMA-2/3、Mistral、Gemma、Qwen 全系)。
解决的核心痛点
解码时每个 token 都要缓存全部历史的 K/V,显存随序列线性增长:缓存大小 =22LHdsb= 2 \cdot 2 \cdot L \cdot H \cdot d \cdot s \cdot b(fp16 每元素 2 字节 × K/V 两份 × 层数 × 头数 × 每头维度 × 序列长 × batch);LLaMA-3 70B 在 s=8192s = 8192b=32b = 32 时 MHA 约需 687GB,远超 140GB 权重,换 GQA(8 组)后约 86GB,省约 87%;MQA 省得最多但质量损失略大,通常只用于小模型。
🎯5 个高频面试考点 (Exam Points)
1
GQA 相比 MHA 省了什么?KV cache 显存公式 22LHdsb2 \cdot 2 \cdot L \cdot H \cdot d \cdot s \cdot b 每项含义?
2
GQA 组数 G 如何选择?质量与显存的权衡?
3
MQA 与 GQA 的区别?各自优缺点?
4
为什么共享 KV 对训练影响小、对推理影响大?(KV cache 只在推理出现)
5
主流模型分别用什么配置?LLaMA-2/3、Mistral、Qwen 的 KV 头数?
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「注意力变体 MHA/MQA/GQA」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点缩放点积注意力下一个知识点MLA 低秩 KV 压缩

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据评测基准 MMLU/GSM8K分词 BPE/WordPiece