M2-037M2: Classical Machine LearningSupport Vector Machines & KernelsEasy
Mastery:

Support Vector Machines & Kernels: 写出软间隔 SVM 的目标,并解释 C 的作用。

📐 Mathematical Definition
min⁡12∥w∥2+C∑iξi s.t. yi(w⊤xi+b)≥1−ξi\min\tfrac12\|w\|^2+C\sum_i\xi_i\ \text{s.t.}\ y_i(w^\top x_i+b)\ge1-\xi_i
⚡ Executive Summary
Core Concept: 引入松弛变量允许违反间隔;C 控制对违反的惩罚强度。

📌 Key Takeaways

  • •
    C 大 → 低偏差高方差(过拟合)
  • •
    C 小 → 高偏差低方差

📐 Mathematical Derivations

软间隔的构造:引入松弛变量 ξᵢ≥0 允许样本落在间隔内(0<ξᵢ<1,仍分类正确)甚至被错分(ξᵢ>1),约束变为 yᵢ(wᵀxᵢ+b)≥1−ξᵢ。目标为 ½‖w‖²+C·Σξᵢ:第一项最大化间隔(正则),第二项惩罚违反(损失)。<strong>C 的角色</strong>等价于正则化强度的倒数:C 大 → 惩罚违反严厉 → 尽量拟合所有样本 → 低偏差高方差(类似小 λ 的正则);C 小 → 容忍更多违反 → 更宽的间隔、更简单的边界 → 高偏差低方差。<strong>等价形式</strong>:软间隔 SVM 可写为 min ½‖w‖²+C·Σmax(0,1−yᵢ(wᵀxᵢ+b)),即 <strong>L2 正则 + hinge 损失</strong>,其中 hinge loss = max(0,1−margin) 在 margin≥1 时为 0(稀疏梯度)。

🏭 Production Trade-offs

实践要点:① <strong>hinge vs logistic loss</strong>——hinge(SVM)在 margin>1 时损失与梯度均为 0,故解<strong>稀疏</strong>(只有支持向量贡献);logistic(逻辑回归)在所有点都有非零梯度,故解<strong>稠密</strong>(所有样本都影响)。这是两者最大的结构差异。② <strong>hinge 不可导</strong>——在 margin=1 处不可导,需用次梯度或对偶求解;这也是 SVM 常用 QP 求解器的原因。③ <strong>C 的调参</strong>——在<strong>对数尺度</strong>上网格搜索(如 2⁻⁵…2⁵),配合交叉验证;C 与 γ(RBF 核)需联合调优(二维网格)。④ <strong>不平衡数据</strong>——可用<strong>类权重</strong>(Cᵢ=C·w_{yᵢ},少数类给更大权重),或调整决策阈值。⑤ <strong>SVM 不输出概率</strong>——需用 Platt scaling(在验证集上拟合 sigmoid 把决策值转为概率)或 isotonic 校准,且校准后概率的可靠性依赖校准集大小。
⚠️ Common Interview Pitfalls
  • ✕
    认为 C 越大越好(过拟合)
  • ✕
    把 SVM 的决策值当作概率使用(需校准)
🎯 Interviewer Follow-ups
  • ?
    C 与正则化强度的关系?
  • ?
    hinge loss 与 logistic loss 的区别?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-036: Support Vector Machines & Kernels: 解释 SVM 的间隔最大化思想与支持向量的作用。📋Back to BankNext →M2-038: Support Vector Machines & Kernels: 解释核技巧,为什么它能在不显式计算高维映射的情况下工作。