🎯核心定义
推理量化 = 把模型权重(必要时含激活与 KV)从 FP16 降到 INT8/INT4/FP8,用显存换吞吐的服务侧落地手段(量化原理与误差分析详见 LLM 模块,本卡聚焦服务落地)。三种主流方案: ① INT8 W8A8(权重与激活皆 8-bit): 激活存在离群值(outliers),需 SmoothQuant 把离群从激活迁移到权重再做激活量化;② INT4 W4A16(权重 4-bit、激活 FP16): AWQ 按激活幅度感知,把通道级 scale 乘进权重、保护对输出影响大的“重要通道”,校准集小、无需反向传播,比 GPTQ 更便宜;③ FP8(E4M3): H100/B200 Tensor Core 原生支持,动态范围大、几乎无需校准,是新一代服务默认。显存账本: 7B FP16 ≈ 14GB → INT8 ≈ 7GB → INT4 ≈ 3.5GB;70B 从 ≈ 140GB 压到 ≈ 35GB,可单卡部署。
💡使用场景
服务侧把模型压进更少 GPU、同卡并发批更大,降低每 token 成本;面试中 LLM 模块考原理(量化误差/校准),AI_Infra 考落地——vLLM/SGLang 的 GPTQ/AWQ/FP8 后端选型、group size(如 128/32)、批大小与显存核算。
⚡解决的核心痛点
相比 FP16,INT4 权重显存降 4 倍(14GB → 3.5GB),可驻留的单卡模型规模翻 4 倍,同样显存下并发批更大、服务吞吐近似翻倍;代价是激活离群值与量化噪声带来的精度损失,需校准数据与 AWQ/SmoothQuant 等算法缓解——显存、精度、吞吐构成核心权衡三角,需按延迟预算与质量门禁用实际评估集权衡。