返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: vector-distance-metrics

向量距离度量与 L2 归一化

Vector Distance Metrics & L2 Normalization
🎯核心定义
向量距离度量是衡量高维 Embedding 空间中两个向量几何相似性的数学函数,常用度量包括余弦相似度 (Cosine Similarity) cos(u,v)=uvuv\cos(u, v) = \frac{u \cdot v}{\|u\| \|v\|}、欧氏距离 (Euclidean / L2 Distance) d(u,v)=uv2d(u, v) = \|u - v\|_2 以及点积 (Dot / Inner Product) u,v=uv\langle u, v \rangle = u \cdot v;当向量预先经过 L2 归一化 (u2=1\|u\|_2 = 1) 时,L2 距离与余弦相似度满足单调等价关系 d2(u,v)=22cos(u,v)d^2(u, v) = 2 - 2\cos(u, v),点积亦与余弦相似度完全等价。
💡使用场景
向量数据库 (Milvus, Qdrant) 建立索引配置度量类型、RAG 语义检索召回计算相似度、以及硬件加速矩阵乘法阶段统一输入尺度。
解决的核心痛点
原始余弦相似度在检索时需每次实时计算向量模长 u\|u\|v\|v\|,开方与除法运算对 SIMD/GPU 硬件极其昂贵;通过离线 L2 归一化后直接调用 GEMM 点积,大幅降低计算开销与延迟。
🎯5 个高频面试考点 (Exam Points)
1
推导经过 L2 归一化后,L2 距离与余弦相似度之间的数学等价公式?
2
为什么在 GPU/SIMD 上执行点积 (Dot Product) 效率远高于未经归一化的余弦距离?
3
非归一化向量下,为什么点积检索容易受到文本长度和向量模长的严重偏置影响?
4
余弦相似度与曼哈顿距离 (L1) 在高维稀疏向量(如 BM25/SPLADE)中的选型差异?
5
主流向量数据库在创建集合索引时,修改 Metric Type(IP vs COSINE vs L2)是否需要全量重建图索引?
📖 关联深度指南:📄 vector-databases-and-hnsw
更新于 2026-08-14
🎯
检验攻克程度:针对「向量距离度量与 L2 归一化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
下一个知识点SQ8/SQ4 标量量化

🔗 更多 AI 应用工程 知识点卡片

PQ 乘积量化与码本聚类ADC 非对称距离计算IVF 倒排网格与残差量化HNSW 跳表多层图结构