M2-036M2: Classical Machine LearningSupport Vector Machines & KernelsEasy
Mastery:

Support Vector Machines & Kernels: 解释 SVM 的间隔最大化思想与支持向量的作用。

📐 Mathematical Definition
max⁡2∥w∥ s.t. yi(w⊤xi+b)≥1\max\frac{2}{\|w\|}\ \text{s.t.}\ y_i(w^\top x_i+b)\ge1
⚡ Executive Summary
Core Concept: 寻找最大间隔超平面;只有位于间隔边界上的支持向量决定解。

📌 Key Takeaways

  • •
    等价于最小化 ½‖w‖²
  • •
    支持向量对应 μ_i>0 的样本

📐 Mathematical Derivations

间隔最大化的几何与数学:分类超平面 wᵀx+b=0,样本到它的距离为 |wᵀxᵢ+b|/‖w‖。要求所有样本被正确分类且位于间隔外:yᵢ(wᵀxᵢ+b)≥1(这是归一化后的约束,可通过缩放 w、b 实现)。此时间隔宽度为 2/‖w‖,最大化间隔等价于<strong>最小化 ½‖w‖²</strong>(便于求导)。这是一个凸二次规划问题。<strong>对偶与支持向量</strong>:用拉格朗日对偶求解,得到 αᵢ≥0 的乘子;由 KKT 互补松弛,只有 yᵢ(wᵀxᵢ+b)=1 的样本(恰在间隔边界上)才有 αᵢ>0——这些就是<strong>支持向量</strong>。最终 w=Σαᵢyᵢxᵢ 只涉及支持向量,决策函数也只依赖支持向量的内积,故非支持向量的扰动不影响决策边界。

🏭 Production Trade-offs

实践要点:① <strong>稀疏性与鲁棒性</strong>——支持向量通常只占少数样本,故 SVM 对非支持向量的噪声鲁棒;但<strong>支持向量本身的噪声会直接影响边界</strong>(尤其标签错误的支持向量),这是 SVM 对噪声标签敏感的原因。② <strong>硬间隔 vs 软间隔</strong>——硬间隔要求完全可分(现实中很少成立且对噪声零容忍),软间隔引入松弛变量 ξᵢ 允许违反约束,用 C 控制惩罚强度:C 大→接近硬间隔(低偏差高方差),C 小→更宽容(高偏差低方差)。③ <strong>核技巧的基础</strong>——对偶形式只涉及内积 ⟨xᵢ,xⱼ⟩,可直接替换为核函数 K(xᵢ,xⱼ) 实现非线性分类而无需显式映射到高维——这是 SVM 相对其他线性模型的核心优势。④ <strong>计算复杂度</strong>——训练 O(n²–n³)(取决于样本数),故不适合超大规模数据;预测复杂度与<strong>支持向量数</strong>成正比。
⚠️ Common Interview Pitfalls
  • ✕
    认为 SVM 对噪声标签鲁棒(支持向量的标签错误会直接扭曲边界)
  • ✕
    在大规模数据上直接使用核 SVM(应改用线性 SVM 或近似方法)
🎯 Interviewer Follow-ups
  • ?
    为什么只有支持向量重要?
  • ?
    硬间隔与软间隔的区别?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-035: 梯度提升 (GBDT/XGBoost): CatBoost 解决了什么问题?什么是 ordered boosting。📋Back to BankNext →M2-037: Support Vector Machines & Kernels: 写出软间隔 SVM 的目标,并解释 C 的作用。