返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: resampling-methods

重采样方法 SMOTE/ADASYN/Tomek

Resampling Methods: SMOTE/ADASYN/Tomek
🎯核心定义
重采样用数据手段平衡类别分布。SMOTE (合成少数类过采样): 对少数类样本 xix_i, 在 k 近邻中随机选一个近邻 xzix_{z_i}, 沿连线插值生成合成样本 xnew=xi+λ(xzixi)x_{new} = x_i + \lambda(x_{z_i} - x_i), 其中 λU[0,1]\lambda \sim U[0,1], 相比随机复制缓解过拟合。ADASYN (自适应合成): 按少数类样本“难学程度”决定生成量——周围多数类密度越高(越靠近决策边界)的样本生成越多, 把合成样本重心移到难分区域。Tomek Links (清洗): 若 xxyy 互为最近邻且分属不同类别, 二者构成 Tomek Link(边界样本对), 删除其中多数类样本, 常用于与 SMOTE 组合 (SMOTE-Tomek): 先合成边界样本、再清洗边界重叠区。
💡使用场景
类别不平衡且少数类样本量少、特征为连续数值(可插值)时; 面试常问 SMOTE 插值公式、为什么不能用于文本/高维稀疏特征、复制过采样为什么不行。
解决的核心痛点
随机过采样只是复制少数类, 模型在小范围重复样本上过拟合、决策区域过于集中; SMOTE 在局部特征空间插值“凭空生成”新样本, 扩大了少数类决策区域; 但 SMOTE 不处理多数类噪声与边界重叠, 反而可能加重重叠, Tomek Links 把决策面推离重叠边界, 二者组合(如 SMOTE-Tomek)同时缓解过拟合与边界混淆。
🎯5 个高频面试考点 (Exam Points)
1
写出 SMOTE 插值公式 xnew=xi+λ(xzixi)x_{new} = x_i + \lambda(x_{z_i} - x_i), 解释为什么 λ[0,1]\lambda \in [0,1]、为什么能缓解复制过拟合?
2
SMOTE 的局限: 为什么对高维/文本/稀疏特征不安全? 对标签噪声敏感吗?
3
ADASYN 与 SMOTE 的区别? “自适应”体现在哪里(生成数量按什么决定)?
4
Tomek Links 是什么? 它属于过采样还是清洗? 为什么常与 SMOTE 组合使用?
5
SMOTE 应该在划分训练/验证集之前还是之后做? 放在划分前会带来什么泄漏?
📖 关联深度指南:📄 ml-math-and-eval-metrics
更新于 2026-08-12
🎯
检验攻克程度:针对「重采样方法 SMOTE/ADASYN/Tomek」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点类别不平衡下一个知识点Huber 与 Focal Loss

🔗 更多 经典机器学习 知识点卡片

AdaBoost 算法手推Bagging 与随机森林HMM 参数学习 Baum-WelchGBDT 负梯度拟合