返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: scalar-quantization-sq8

SQ8/SQ4 标量量化

Scalar Quantization (SQ8/SQ4)
🎯核心定义
标量量化 (Scalar Quantization, SQ) 是一种针对高维向量各个分量进行独立线性定点映射的压缩技术;SQ8 将 32 位浮点数 (FP32) 按分量动态范围 [mind,maxd][min_d, max_d] 线性映射为 8 位无符号整数 (uint8) q=round(255xminmaxmin)q = \text{round}\left(255 \cdot \frac{x - \min}{\max - \min}\right),SQ4 则进一步压缩至 4 位半字节 (nibble);整体实现 4x (SQ8) 至 8x (SQ4) 的内存压缩。
💡使用场景
向量数据库在内存受限环境下构建海量(千万至数亿级)向量索引,作为 HNSW 原始向量存储缓存层或粗排剪枝层。
解决的核心痛点
1 亿条 1536 维 FP32 向量裸存储需高达 614GB 内存,单机内存无法装载;SQ8 将其压缩至 153GB,且配合 AVX-512 / VNNI 指令集可直接在 int8 整数上并行计算距离,显著提升检索吞吐并保持 98%+ 的 Recall@10 召回率。
🎯5 个高频面试考点 (Exam Points)
1
推导 SQ8 的线性量化与反量化 (De-quantization) 公式及精度损失来源?
2
全局均匀量化 (Global SQ) 与分维度量化 (Per-Dimension SQ) 在长尾分布下的 Recall 差异?
3
现代 CPU 的 AVX-512 VNNI 指令如何加速 int8 向量的点积运算?
4
对比 SQ8 与 PQ (乘积量化) 在内存压缩比、索引构建时间与重构误差上的优劣?
5
为什么在向量经过异常值截断 (Outlier Clipping / Min-Max Percentile) 后,SQ8 的召回率会有所上升?
📖 关联深度指南:📄 vector-databases-and-hnsw
更新于 2026-08-14
🎯
检验攻克程度:针对「SQ8/SQ4 标量量化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点向量距离度量与 L2 归一化下一个知识点PQ 乘积量化与码本聚类

🔗 更多 AI 应用工程 知识点卡片

ADC 非对称距离计算IVF 倒排网格与残差量化HNSW 跳表多层图结构HNSW 启发式邻居选择与路由