TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
MLA 低秩 KV 压缩
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
mla-attention
MLA 低秩 KV 压缩
Multi-head Latent Attention
🎯
核心定义
MLA (Multi-head Latent Attention, 多头潜在注意力) 是 DeepSeek-V2 引入的低秩 KV 压缩方案:先把整层 K/V 压缩成低维潜向量
c
t
K
V
∈
R
d
c
c_t^{KV} \in \mathbb{R}^{d_c}
c
t
K
V
∈
R
d
c
(DeepSeek-V2 取
d
c
=
512
d_c = 512
d
c
=
512
),注意力计算时再上投影还原出每头的 K/V;为兼容 RoPE,额外保留一份只携带位置信息的小尺寸旋转 K(即解耦 RoPE 的
k
t
R
k_t^R
k
t
R
)。
💡
使用场景
DeepSeek-V2/V3/R1 全系列标配,长上下文与大 batch 推理收益最大;2026 年已成为大厂长上下文部署的对标方案,面试必问"MLA 为什么省显存"。
⚡
解决的核心痛点
GQA 只是共享 KV 头,每个 token 仍要缓存
2
H
d
2 H d
2
H
d
个值;MLA 把每 token 缓存压到
d
c
d_c
d
c
,
d
c
=
512
≪
2
H
d
d_c = 512 \ll 2 H d
d
c
=
512
≪
2
H
d
,DeepSeek-V2 对比同规模 GQA 版本,缓存从约 41.5GB 降到约 5.1GB(降约 80%+);训练时 Prefill 阶段从
c
t
K
V
c_t^{KV}
c
t
K
V
重算 K/V,还省下大量激活显存。
🎯
5 个高频面试考点 (Exam Points)
1
MLA 如何压缩 KV?
c
t
K
V
c_t^{KV}
c
t
K
V
的维度与还原过程?
2
MLA 为什么需要解耦 RoPE?
k
t
R
k_t^R
k
t
R
的作用是什么?
3
MLA 相比 GQA 显存省多少?给出具体数字(41.5GB → 5.1GB 的对比)
4
训练时 MLA 如何减少激活显存?(Prefill 阶段重算 K/V)
5
MLA 与 MQA/GQA 的本质区别?(共享 vs 低秩投影)
📖 关联深度指南:
📄 transformer-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「MLA 低秩 KV 压缩」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
注意力变体 MHA/MQA/GQA
下一个知识点 →
SSM/线性注意力混合
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
评测基准 MMLU/GSM8K