K 近邻 (KNN) 是惰性学习 (lazy learning) 的非参数算法: 训练阶段仅存储数据 (零训练开销), 预测时在训练集中找与输入最近的
K 个样本——分类用多数投票, 回归用均值。常用距离加权投票提升鲁棒性: 权重
wi=d(x,xi)1 或
wi=d(x,xi)21, 距离越近的邻居话语权越大; 决策边界由训练点的 Voronoi 区域决定。K 过小 → 高方差过拟合 (预测被 1 个近邻左右), K 过大 → 高偏差欠拟合 (混入远类样本), 常用交叉验证选 K。维度灾难: 高维下样本稀疏, 任意两点距离趋同, 相对距离
dmax−dmin 塌缩, 近邻几乎等距、判别退化为随机, 需降维或特征选择缓解。