TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
AI 应用工程 思维导图
›
SQ8/SQ4 标量量化
← 返回 AI 应用工程 思维导图
中文
·
English
🤖 AI 应用工程
ID:
scalar-quantization-sq8
SQ8/SQ4 标量量化
Scalar Quantization (SQ8/SQ4)
🎯
核心定义
标量量化 (Scalar Quantization, SQ) 是一种针对高维向量各个分量进行独立线性定点映射的压缩技术;SQ8 将 32 位浮点数 (FP32) 按分量动态范围
[
m
i
n
d
,
m
a
x
d
]
[min_d, max_d]
[
mi
n
d
,
ma
x
d
]
线性映射为 8 位无符号整数 (uint8)
q
=
round
(
255
⋅
x
−
min
max
−
min
)
q = \text{round}\left(255 \cdot \frac{x - \min}{\max - \min}\right)
q
=
round
(
255
⋅
m
a
x
−
m
i
n
x
−
m
i
n
)
,SQ4 则进一步压缩至 4 位半字节 (nibble);整体实现 4x (SQ8) 至 8x (SQ4) 的内存压缩。
💡
使用场景
向量数据库在内存受限环境下构建海量(千万至数亿级)向量索引,作为 HNSW 原始向量存储缓存层或粗排剪枝层。
⚡
解决的核心痛点
1 亿条 1536 维 FP32 向量裸存储需高达 614GB 内存,单机内存无法装载;SQ8 将其压缩至 153GB,且配合 AVX-512 / VNNI 指令集可直接在 int8 整数上并行计算距离,显著提升检索吞吐并保持 98%+ 的 Recall@10 召回率。
🎯
5 个高频面试考点 (Exam Points)
1
推导 SQ8 的线性量化与反量化 (De-quantization) 公式及精度损失来源?
2
全局均匀量化 (Global SQ) 与分维度量化 (Per-Dimension SQ) 在长尾分布下的 Recall 差异?
3
现代 CPU 的 AVX-512 VNNI 指令如何加速 int8 向量的点积运算?
4
对比 SQ8 与 PQ (乘积量化) 在内存压缩比、索引构建时间与重构误差上的优劣?
5
为什么在向量经过异常值截断 (Outlier Clipping / Min-Max Percentile) 后,SQ8 的召回率会有所上升?
📖 关联深度指南:
📄 vector-databases-and-hnsw →
更新于 2026-08-14
🎯
检验攻克程度:针对「SQ8/SQ4 标量量化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
向量距离度量与 L2 归一化
下一个知识点 →
PQ 乘积量化与码本聚类
🔗 更多 AI 应用工程 知识点卡片
ADC 非对称距离计算
IVF 倒排网格与残差量化
HNSW 跳表多层图结构
HNSW 启发式邻居选择与路由