M4-102M4: Sequences & TransformersModel Compression & DistillationMedium
Mastery:
Model Compression & Distillation: 解释推理加速的几条路线与适用条件。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 量化、剪枝/稀疏、蒸馏/小模型、架构优化(注意力)、系统优化(批处理/融合/编译)、投机解码。
📌 Key Takeaways
- •模型侧:量化、稀疏、蒸馏、架构(GQA/滑窗/SSM)
- •系统侧:批处理、融合、编译、PD 分离
- •解码侧:投机解码(改善单请求延迟)
📐 Mathematical Derivations
数学机理:<strong>六条路线</strong>,按'作用层次'分类。<strong>(1) 量化(quantization)</strong>——降低权重/激活/KV 的位数(FP16→INT8/INT4);收益稳定(2~4 倍)、质量损失可控、生态成熟(GPTQ/AWQ/vLLM)。<strong>适用条件</strong>:几乎所有推理场景(尤其 memory-bound)。<strong>(2) 稀疏/剪枝</strong>——减少计算(结构化/2:4)或参数;收益依赖硬件支持(2:4 稀疏有原生加速)。<strong>适用条件</strong>:有稀疏硬件支持、且能接受质量损失。<strong>(3) 蒸馏/小模型</strong>——用更小的模型达到接近的质量;收益最大(可能 10 倍以上),但需重训、且上限受小模型容量限制。<strong>适用条件</strong>:有充足训练资源、可接受质量上限。<strong>(4) 架构优化</strong>——GQA/MLA(省 KV)、滑窗/稀疏注意力(省计算)、SSM(线性复杂度);收益大(尤其长上下文)、但需'训练时就用'(不能事后改)。<strong>适用条件</strong>:可从头训练或继续预训练。<strong>(5) 系统优化</strong>——批处理(连续批)、算子融合、编译(torch.compile/TensorRT)、PD 分离;收益大(2~10 倍)、<strong>无损</strong>(不改模型)、但需工程投入。<strong>适用条件</strong>:服务端部署(高并发)。<strong>(6) 投机解码</strong>——用草稿模型一次验证多 token;改善<strong>单请求延迟</strong>(2~3 倍),大 batch 时收益下降。<strong>适用条件</strong>:低负载、延迟敏感的场景。<strong>叠加性</strong>——六条路线<strong>基本正交</strong>,可叠加(如:量化 + GQA + 连续批处理 + 融合 + 投机解码);实践中按'<strong>无损优先(系统优化)→ 低风险(量化)→ 需训练(架构/蒸馏)→ 有风险(稀疏)</strong>'的顺序推进。<strong>收益的'记忆点'</strong>——量化 2~4×、系统优化 2~10×、蒸馏 10×+、投机 2~3×(延迟)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'无损优先'的工程原则</strong>——系统优化(批处理/融合/编译)不改模型、无质量损失,应<strong>首先做</strong>;量化质量损失小、生态成熟,<strong>其次</strong>;架构/蒸馏需训练,<strong>再次</strong>;稀疏风险最大,<strong>最后</strong>。这是实践中的推进顺序。② <strong>memory-bound vs compute-bound 的对应</strong>——(a) <strong>memory-bound 场景</strong>(decode、长上下文)→ 优先'减少字节'(量化、GQA/MLA、KV 压缩);(b) <strong>compute-bound 场景</strong>(prefill、大 batch 训练)→ 优先'减少 FLOPs'(稀疏、蒸馏、架构)。理解瓶颈才能选对路线(见 roofline 题)。③ <strong>'收益的来源'分解</strong>——不同路线的收益机制不同:量化省带宽、稀疏省算力、蒸馏省两者、系统优化省固定开销;故它们的<strong>收益曲线</strong>随负载变化(如投机解码在小 batch 收益大、大 batch 收益小)。④ <strong>工程成熟度</strong>——量化的工具链最成熟(vLLM/TensorRT-LLM/GPTQ/AWQ);架构优化的收益最大但需重训;系统优化需深度工程投入。⑤ <strong>与 SLO 的关系</strong>——优化需在'延迟 SLO'约束下最大化吞吐(goodput),而非无约束最大化吞吐;故需按 SLO 选择路线组合。⑥ <strong>面试要点</strong>——被问'如何加速推理',应给出'<strong>六条路线 + 作用层次 + 叠加性 + 推进顺序(无损优先)</strong>',并能按'瓶颈(memory/compute-bound)'选择路线;这是推理优化类问题的框架性回答。
⚠️ Common Interview Pitfalls
- ✕只提量化而不知其他路线
- ✕不区分 memory-bound 与 compute-bound 的优化方向
🎯 Interviewer Follow-ups
- ?哪条路线的收益最稳定?
- ?各路线能否叠加?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.