自回归解码时每个新 token 都要 attend 全部历史,把历史 K/V 缓存起来避免重复计算;缓存大小
=2⋅2⋅L⋅H⋅d⋅s⋅b(fp16 每元素 2 字节 × K/V 两份 × 层数 × 头数 × 每头维度 × 序列长 × batch);LLaMA-3 70B 在
s=8192、
b=32 时约 687GB,远超其 140GB 权重,GQA 8 组后约 86GB。管理手段:PagedAttention(vLLM) 以 16 token 为块用页表管理,消除碎片;StreamingLLM 用 attention sink + 滚动窗口;PD 分离把 Prefill 与 Decode 拆到不同实例。