重采样用数据手段平衡类别分布。SMOTE (合成少数类过采样): 对少数类样本
xi, 在 k 近邻中随机选一个近邻
xzi, 沿连线插值生成合成样本
xnew=xi+λ(xzi−xi), 其中
λ∼U[0,1], 相比随机复制缓解过拟合。ADASYN (自适应合成): 按少数类样本“难学程度”决定生成量——周围多数类密度越高(越靠近决策边界)的样本生成越多, 把合成样本重心移到难分区域。Tomek Links (清洗): 若
x 与
y 互为最近邻且分属不同类别, 二者构成 Tomek Link(边界样本对), 删除其中多数类样本, 常用于与 SMOTE 组合 (SMOTE-Tomek): 先合成边界样本、再清洗边界重叠区。