TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
注意力变体 MHA/MQA/GQA
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
attention-variants
注意力变体 MHA/MQA/GQA
Attention Variants MHA/MQA/GQA
🎯
核心定义
MHA (Multi-Head Attention) 每个头独立投影 K/V;MQA (Multi-Query Attention) 所有头共享同一组 K/V(即只有 1 个 KV 头);GQA (Grouped-Query Attention) 把
H
H
H
个查询头分成
G
G
G
组、组内共享 K/V,是两者的折中:LLaMA-2/3 70B 用 8 个 KV 头,LLaMA-2 7B 用 MQA,Mistral/Gemma/Qwen 普遍用 GQA。
💡
使用场景
推理时 KV cache 显存受限的所有自回归服务场景;2023 年后 GQA 成为大模型事实标准(LLaMA-2/3、Mistral、Gemma、Qwen 全系)。
⚡
解决的核心痛点
解码时每个 token 都要缓存全部历史的 K/V,显存随序列线性增长:缓存大小
=
2
⋅
2
⋅
L
⋅
H
⋅
d
⋅
s
⋅
b
= 2 \cdot 2 \cdot L \cdot H \cdot d \cdot s \cdot b
=
2
⋅
2
⋅
L
⋅
H
⋅
d
⋅
s
⋅
b
(fp16 每元素 2 字节 × K/V 两份 × 层数 × 头数 × 每头维度 × 序列长 × batch);LLaMA-3 70B 在
s
=
8192
s = 8192
s
=
8192
、
b
=
32
b = 32
b
=
32
时 MHA 约需 687GB,远超 140GB 权重,换 GQA(8 组)后约 86GB,省约 87%;MQA 省得最多但质量损失略大,通常只用于小模型。
🎯
5 个高频面试考点 (Exam Points)
1
GQA 相比 MHA 省了什么?KV cache 显存公式
2
⋅
2
⋅
L
⋅
H
⋅
d
⋅
s
⋅
b
2 \cdot 2 \cdot L \cdot H \cdot d \cdot s \cdot b
2
⋅
2
⋅
L
⋅
H
⋅
d
⋅
s
⋅
b
每项含义?
2
GQA 组数 G 如何选择?质量与显存的权衡?
3
MQA 与 GQA 的区别?各自优缺点?
4
为什么共享 KV 对训练影响小、对推理影响大?(KV cache 只在推理出现)
5
主流模型分别用什么配置?LLaMA-2/3、Mistral、Qwen 的 KV 头数?
📖 关联深度指南:
📄 transformer-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「注意力变体 MHA/MQA/GQA」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
缩放点积注意力
下一个知识点 →
MLA 低秩 KV 压缩
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
评测基准 MMLU/GSM8K
分词 BPE/WordPiece