M4-106M4: Sequences & TransformersQuantization & AccelerationEasy
Mastery:
Quantization & Acceleration: 解释对称量化与非对称量化的差异。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 对称量化以 0 为原点(zero_point=0,只有 scale);非对称量化用 (scale, zero_point) 映射任意区间 [min,max]。
📌 Key Takeaways
- •对称:零点固定为 0,实现简单、速度快
- •非对称:可映射任意区间,适合分布不对称的数据
- •非对称需额外存储 zero_point(每通道/每张量)
📐 Mathematical Derivations
数学机理:<strong>对称量化(symmetric)</strong>——量化映射为 q=round(x/s),其中 s=max|x|/(2^{b−1}−1);<strong>零点固定为 0</strong>(即 0 精确映射到 0)。<strong>优点</strong>——(a) 只需一个参数 s(无需 zero_point),存储与计算更省;(b) <strong>实现简单、硬件友好</strong>(很多加速器/张量核心只支持对称的整数乘加);(c) <strong>0 精确表示</strong>(对'稀疏/置零'友好的场景重要,如 ReLU 后的 0、padding)。<strong>缺点</strong>——若数据分布<strong>不对称</strong>(如 ReLU 后全为非负、或分布偏斜),则对称量化会浪费一半的表示范围(因为要覆盖 [−max, +max],而实际只在 [0, max]),有效精度下降。<strong>非对称量化(asymmetric)</strong>——量化映射为 q=round(x/s)+z,其中 s=(max−min)/(2^b−1)、z 为 zero_point(使 min 映射到 0);可<strong>精确覆盖任意区间 [min, max]</strong>。<strong>优点</strong>——(a) 充分利用表示范围(对不对称分布更精确);(b) 可表达'非零最小值'。<strong>缺点</strong>——(a) 需额外存储 zero_point;(b) 计算需处理偏移(q 与 z 的减法),实现稍复杂、硬件支持不如对称广泛。<strong>选择依据</strong>——(a) <strong>权重</strong>:通常近似对称(围绕 0 分布),故常用<strong>对称</strong>;(b) <strong>激活</strong>:ReLU 后非负、或分布偏斜,故<strong>非对称</strong>更优(但也可通过'非负对称量化'处理);(c) 硬件约束:若加速器只支持对称,则必须用对称。<strong>其他相关</strong>——(a) <strong>per-tensor vs per-channel</strong>(粒度);(b) <strong>动态 vs 静态</strong>(激活的范围是否随输入动态计算);(c) <strong>仿射 vs 幂次</strong>(如 pow2 量化便于移位实现)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'对称 + 硬件'的强耦合</strong>——许多整数张量核心(如 NVIDIA 的 INT8 支持)对对称量化的支持更好;故即使非对称理论上更准,工程上常选对称(或用'非负激活的对称量化'变体)。这是'算法-硬件协同设计'的又一例证。② <strong>zero_point 的作用</strong>——它使量化能'平移'区间,从而对齐数据的实际范围;对'全为正的激活'(ReLU 后)尤其重要(否则一半格点浪费)。③ <strong>粒度与对称性的正交</strong>——两者是独立维度:可以'per-channel 对称'或'per-tensor 非对称';实践中常组合(如权重 per-channel 对称、激活 per-tensor 非对称)。④ <strong>与离群值的关系</strong>——对称量化的 s 由 max|x| 决定,故<strong>离群值会直接撑大 s</strong>、压缩有效精度;这再次说明离群值是量化的核心难题(与对称性无关)。⑤ <strong>KV cache 量化的选择</strong>——K 通常按通道(per-channel)量化(对称或非对称),V 按 token(per-token);这与'离群值的方向'相关(见 KV 量化题)。⑥ <strong>面试要点</strong>——被问'对称 vs 非对称',应给出'<strong>零点是否固定为 0 + 适用分布(对称 vs 偏斜)+ 硬件友好度</strong>'三维对比,并说明'权重常对称、激活常非对称'与'对称更受硬件支持';能联系到'离群值撑大 scale'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为非对称量化全面优于对称(硬件支持是约束)
- ✕忽略离群值对 scale 的破坏(与对称性无关)
🎯 Interviewer Follow-ups
- ?什么分布适合对称量化?
- ?为什么对称量化在硬件上更快?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.