返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: quantization-inference

推理量化(跨模块)

Inference Quantization (cross-module)
🎯核心定义
推理量化 = 把模型权重(必要时含激活与 KV)从 FP16 降到 INT8/INT4/FP8,用显存换吞吐的服务侧落地手段(量化原理与误差分析详见 LLM 模块,本卡聚焦服务落地)。三种主流方案: ① INT8 W8A8(权重与激活皆 8-bit): 激活存在离群值(outliers),需 SmoothQuant 把离群从激活迁移到权重再做激活量化;② INT4 W4A16(权重 4-bit、激活 FP16): AWQ 按激活幅度感知,把通道级 scale 乘进权重、保护对输出影响大的“重要通道”,校准集小、无需反向传播,比 GPTQ 更便宜;③ FP8(E4M3): H100/B200 Tensor Core 原生支持,动态范围大、几乎无需校准,是新一代服务默认。显存账本: 7B FP16 ≈ 14GB → INT8 ≈ 7GB → INT4 ≈ 3.5GB;70B 从 ≈ 140GB 压到 ≈ 35GB,可单卡部署。
💡使用场景
服务侧把模型压进更少 GPU、同卡并发批更大,降低每 token 成本;面试中 LLM 模块考原理(量化误差/校准),AI_Infra 考落地——vLLM/SGLang 的 GPTQ/AWQ/FP8 后端选型、group size(如 128/32)、批大小与显存核算。
解决的核心痛点
相比 FP16,INT4 权重显存降 4 倍(14GB → 3.5GB),可驻留的单卡模型规模翻 4 倍,同样显存下并发批更大、服务吞吐近似翻倍;代价是激活离群值与量化噪声带来的精度损失,需校准数据与 AWQ/SmoothQuant 等算法缓解——显存、精度、吞吐构成核心权衡三角,需按延迟预算与质量门禁用实际评估集权衡。
🎯5 个高频面试考点 (Exam Points)
1
W8A8 与 W4A16 的区别?为什么激活量化比权重量化难(离群值),SmoothQuant 如何把离群从激活迁移到权重?
2
AWQ 原理: 为什么按激活幅度感知给“重要通道”更大的 scale 能保精度?与 GPTQ 相比为什么校准更便宜(无需反向传播)?
3
FP8 服务侧: E4M3 布局、H100 原生支持;与 INT8 相比动态范围更大、校准需求更小;什么场景仍需要 INT4?
4
服务落地账: 7B FP16 ≈ 14GB → INT8 ≈ 7GB → INT4 ≈ 3.5GB;同样显存下批大小与吞吐如何变化?group size 128/32 如何影响精度与开销?
5
显存-精度-吞吐权衡: 训练后量化(PTQ)与量化感知训练(QAT)各自何时选?上线前如何验证量化精度损失在质量门禁内?
更新于 2026-08-12
🎯
检验攻克程度:针对「推理量化(跨模块)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点高并发与负载均衡下一个知识点FlashAttention 与 Online Softmax

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)弹性伸缩与成本优化检查点与故障恢复