KV Cache 优化 = 压缩自回归推理中逐层缓存的 K/V 张量,破解长上下文与大批次的显存瓶颈。显存公式:
2×2×L×H×d×s×b 字节(每 token 的 K、V 两张 × FP16 的 2 字节 × 层数 × 头数 × 头维 × 序列长 × 批大小)。四条主线: ① 结构压缩 —— GQA 让多个 Q 头共享一组 KV 头(如 64 → 8,显存 /8);MLA(DeepSeek-V2)把每层的 K/V 压缩成低秩潜在向量
ctKV=WDKVht,推理时
WUK 的投影被吸收进
WQ 与输出投影,只缓存潜在向量——对照 MHA 的 86GB,KV 显存降到 5.1GB(降 93.3%);② KV 量化 —— K/V 用 INT8/FP8 存储,显存减半且精度损失小;③ StreamingLLM —— 保留“attention sink”(前 4 个 token)+ 滑动窗口,长会话显存从
O(s) 降为
O(窗口);④ H2O 稀疏 —— 按累计注意力分数只保留 heavy-hitter token,动态替换。