返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-quantization-pruning-basics

模型压缩、剪枝与量化基础

Model Compression, Pruning & Quant
🎯核心定义
模型压缩、剪枝与量化基础 (Model Compression, Pruning & Low-Bit Quantization Fundamentals) 是机器学习工程师在将庞大的深度学习模型部署至边缘端设备或云端高并发推理服务时,极致压缩参数体积、降低显存带宽并加速计算的核心工程体系;核心三大手段:1) 结构化与非结构化剪枝 (Pruning: 基于权重绝对值或二阶导数 Hessian 矩阵剔除冗余通道/权重,使模型稀疏化);2) 知识蒸馏 (Knowledge Distillation: 用大教师模型的软目标概率分布 pT=softmax(zT/T)p_T = \text{softmax}(z_T / T) 指导小学生模型学习);3) 低比特量化:将 FP32/FP16 浮点张量线性映射为 INT8/INT4/FP8 整型表示 xq=clamp(round(xS)+Z,qmin,qmax)x_q = \text{clamp}\left(\text{round}\left(\frac{x}{S}\right) + Z, q_{\min}, q_{\max}\right),分为训练后量化 (PTQ) 与量化感知训练 (QAT)。
💡使用场景
移动端端侧模型部署 (ONNX/NCNN/TensorFlow Lite)、云端大模型推理加速 (vLLM/TensorRT-LLM/AWQ/GPTQ)、算力成本削减。
解决的核心痛点
深度神经网络参数量巨大(数十亿参数动辄数十 GB 显存),不仅难以装入移动端手机内存,而且在服务器端推理时受限于 GPU 显存带宽 (Memory-Bound);压缩与量化技术在几乎无损精度的前提下将显存压缩 4~8 倍并将推理吞吐提升 300%。
🎯5 个高频面试考点 (Exam Points)
1
推导仿射量化 (Affine/Asymmetric Quantization) 中缩放因子 S=xmaxxminqmaxqminS = \frac{x_{\max} - x_{\min}}{q_{\max} - q_{\min}} 与零点偏移 Z=round(xminS)+qminZ = \text{round}\left(\frac{-x_{\min}}{S}\right) + q_{\min} 的数学公式?
2
详细对比训练后量化 (PTQ) 与量化感知训练 (QAT): 为什么 QAT 在前向传播时使用伪量化 (FakeQuantize) 并在反向传播时使用直通估计器 (STE: Straight-Through Estimator)?
3
结构化剪枝 (Structured Pruning: 剪除整个卷积核/注意力头) 与非结构化剪枝 (Unstructured Pruning: 随机零散权重稀疏) 在硬件加速器上的真实执行效率差异?
4
知识蒸馏中温度系数 TT (Temperature) 的作用:为什么高温 TT 能放大负标签之间的隐式相似度信息 (Dark Knowledge)?
5
大模型前沿权重激活量化算法:AWQ (基于激活感知的通道加权保护) 与 SmoothQuant (将激活值量化难度数学等价迁移到权重) 的核心原理?
📖 关联深度指南:📄 mle-core-cheatsheet
更新于 2026-08-14
🎯
检验攻克程度:针对「模型压缩、剪枝与量化基础」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点模型集成 Stacking 与 Blending下一个知识点手撕 Multi-Head Self-Attention

🔗 更多 MLE 工程师 知识点卡片

偏差-方差权衡与过拟合诊断常见损失函数选型与梯度特性优化器收敛性与动量选型准则手写 Softmax 防溢出与 Cross-Entropy