返回 大语言模型 思维导图
中文·English
大语言模型ID: mla-attention

MLA 低秩 KV 压缩

Multi-head Latent Attention
🎯核心定义
MLA (Multi-head Latent Attention, 多头潜在注意力) 是 DeepSeek-V2 引入的低秩 KV 压缩方案:先把整层 K/V 压缩成低维潜向量 ctKVRdcc_t^{KV} \in \mathbb{R}^{d_c}(DeepSeek-V2 取 dc=512d_c = 512),注意力计算时再上投影还原出每头的 K/V;为兼容 RoPE,额外保留一份只携带位置信息的小尺寸旋转 K(即解耦 RoPE 的 ktRk_t^R)。
💡使用场景
DeepSeek-V2/V3/R1 全系列标配,长上下文与大 batch 推理收益最大;2026 年已成为大厂长上下文部署的对标方案,面试必问"MLA 为什么省显存"。
解决的核心痛点
GQA 只是共享 KV 头,每个 token 仍要缓存 2Hd2 H d 个值;MLA 把每 token 缓存压到 dcd_c,dc=5122Hdd_c = 512 \ll 2 H d,DeepSeek-V2 对比同规模 GQA 版本,缓存从约 41.5GB 降到约 5.1GB(降约 80%+);训练时 Prefill 阶段从 ctKVc_t^{KV} 重算 K/V,还省下大量激活显存。
🎯5 个高频面试考点 (Exam Points)
1
MLA 如何压缩 KV?ctKVc_t^{KV} 的维度与还原过程?
2
MLA 为什么需要解耦 RoPE?ktRk_t^R 的作用是什么?
3
MLA 相比 GQA 显存省多少?给出具体数字(41.5GB → 5.1GB 的对比)
4
训练时 MLA 如何减少激活显存?(Prefill 阶段重算 K/V)
5
MLA 与 MQA/GQA 的本质区别?(共享 vs 低秩投影)
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「MLA 低秩 KV 压缩」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点注意力变体 MHA/MQA/GQA下一个知识点SSM/线性注意力混合

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力评测基准 MMLU/GSM8K