返回 大语言模型 思维导图
中文·English
大语言模型ID: smoothquant-awq-fp8

激活异常值处理与 FP8

SmoothQuant/AWQ & FP8
🎯核心定义
三类进阶量化方案: SmoothQuant 把激活异常值通过数学等价变换迁移到权重上——改写为 Y=(Xdiag(s))(diag(s)1W)Y = (X \cdot \text{diag}(s)) \cdot (\text{diag}(s)^{-1} W) 的激活后计算不变,却让激活分布变得平滑、可直接 INT8 化,实现 W8A8;AWQ (Activation-aware Weight Quantization) 根据激活统计识别敏感通道,保护前 1% 最重要的权重通道 (仅用 scale 缩放不训练),实现 W4A16 高精度;FP8 提供两种格式——E4M3 (4 位指数 3 位尾数,精度高) 用于前向/权重,E5M2 (5 位指数 2 位尾数,范围大) 用于梯度/反向。
💡使用场景
激活异常值明显时 (LLaMA 等模型个别通道方差极大) 用 SmoothQuant 做 W8A8 推理;部署超大规模模型时用 AWQ 做 W4A16 权重量化;FP8 是 H100/B200 时代大模型预训练与微调的主流精度,前向反向分工使用。
解决的核心痛点
激活异常值是 LLM 量化的主要障碍——激活量化常比权重量化更难;SmoothQuant 消除异常值、AWQ 保护关键通道、FP8 用两种格式在精度与动态范围之间分工,三种方案共同把“激活/权重量化精度崩”问题逐一解决。
🎯5 个高频面试考点 (Exam Points)
1
SmoothQuant 为什么有效?异常值如何迁到权重上?
2
AWQ 如何识别敏感通道?为什么保护前 1% 通道?
3
FP8 的 E4M3 与 E5M2 有何区别?各自用于何处?
4
W8A8 与 W4A16 分别是什么?收益如何?
5
为什么激活比权重更难量化?
更新于 2026-08-12
🎯
检验攻克程度:针对「激活异常值处理与 FP8」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点低比特 INT8/INT4下一个知识点知识蒸馏

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA