距离度量定义特征空间中的相似度, 直接决定 KNN/聚类/检索的结果。常用度量: 欧氏距离
d2(x,y)=∑i(xi−yi)2 (L2, 各维同量纲时最自然); 曼哈顿距离
d1(x,y)=∑i∣xi−yi∣ (L1, 对异常值更鲁棒, 高维下相对距离比 L2 稳定); 余弦相似度
cosθ=∥x∥∥y∥x⋅y (只看方向、忽略幅度, 是文本 TF-IDF/Embedding 检索的标配); 闵可夫斯基距离
dp(x,y)=(∑i∣xi−yi∣p)1/p 统一三者 (
p=1 曼哈顿,
p=2 欧氏)。空间索引: KD-Tree 沿坐标中位数递归二分空间, 低维查询可到
O(logn) 量级; Ball-Tree 用超球划分, 高维下更稳。特征缩放: 量纲不同的特征以绝对数值主导距离, 必须先 z-score 标准化 (或 min-max 归一化)。