返回 大语言模型 思维导图
中文·English
大语言模型ID: ptq-qat

量化 PTQ/QAT

Quantization PTQ/QAT
🎯核心定义
量化把 FP16 权重 WW 映射到低比特整数 xq=round(x/s)+zx_q = \text{round}(x/s) + z,其中 scale s=(xmaxxmin)/(2b1)s = (x_{\max}-x_{\min})/(2^b-1)、zero-point zz 由 b-bit 范围对齐。PTQ (Post-Training Quantization, 训练后量化) 用一小段校准集统计激活/权重分布,直接量化已训练模型,无需重训;QAT (Quantization-Aware Training, 量化感知训练) 在训练中模拟量化误差 (STE 直通估计器: 前向走量化路径、反向近似直通),让模型主动适应量化。
💡使用场景
LLM 推理部署以 PTQ 为主 (GPTQ/AWQ 等),因为大模型已训练完成、无法负担重训成本,PTQ 只需分钟级校准;QAT 用于极端低比特 (INT4/INT3 以下)、精度敏感的垂直场景,或在微调阶段联合量化端到端优化。
解决的核心痛点
直接按分布均匀量化会因激活异常值与分布失配造成严重精度损失;PTQ 用校准与误差补偿把损失压到可接受范围,而 QAT 通过训练让权重分布匹配量化器——两者是部署速度与精度的权衡两端:PTQ 快但精度天花板低, QAT 慢但精度上限高。
🎯5 个高频面试考点 (Exam Points)
1
PTQ 与 QAT 的区别?各自的适用场景?
2
PTQ 中校准集的作用?校准集规模/分布如何影响精度?
3
QAT 中直通估计器 (STE) 的原理?为什么需要它?
4
为什么 LLM 领域以 PTQ 为主?什么情况必须用 QAT?
5
量化误差如何衡量?常见的误差来源有哪些?
更新于 2026-08-12
🎯
检验攻克程度:针对「量化 PTQ/QAT」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点对齐税与偏好数据下一个知识点低比特 INT8/INT4

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用缩放点积注意力注意力变体 MHA/MQA/GQA评测基准 MMLU/GSM8K