量化把 FP16 权重
W 映射到低比特整数
xq=round(x/s)+z,其中 scale
s=(xmax−xmin)/(2b−1)、zero-point
z 由 b-bit 范围对齐。PTQ (Post-Training Quantization, 训练后量化) 用一小段校准集统计激活/权重分布,直接量化已训练模型,无需重训;QAT (Quantization-Aware Training, 量化感知训练) 在训练中模拟量化误差 (STE 直通估计器: 前向走量化路径、反向近似直通),让模型主动适应量化。