模型压缩、剪枝与量化基础 (Model Compression, Pruning & Low-Bit Quantization Fundamentals) 是机器学习工程师在将庞大的深度学习模型部署至边缘端设备或云端高并发推理服务时,极致压缩参数体积、降低显存带宽并加速计算的核心工程体系;核心三大手段:1) 结构化与非结构化剪枝 (Pruning: 基于权重绝对值或二阶导数 Hessian 矩阵剔除冗余通道/权重,使模型稀疏化);2) 知识蒸馏 (Knowledge Distillation: 用大教师模型的软目标概率分布
pT=softmax(zT/T) 指导小学生模型学习);3) 低比特量化:将 FP32/FP16 浮点张量线性映射为 INT8/INT4/FP8 整型表示
xq=clamp(round(Sx)+Z,qmin,qmax),分为训练后量化 (PTQ) 与量化感知训练 (QAT)。