返回 经典机器学习 思维导图
中文·English
📊 经典机器学习ID: soft-margin

软间隔 C 与 Hinge

Soft Margin & Hinge
🎯核心定义
数据线性不可分时硬间隔 (要求 yi(wTxi+b)1y_i(w^Tx_i + b) \ge 1) 无可行解。软间隔引入松弛变量 ξi0\xi_i \ge 0, 允许样本越界但付出线性惩罚: minw,b,ξ12w2+Ci=1nξi\min_{w,b,\xi} \frac{1}{2}\Vert w\Vert^2 + C\sum_{i=1}^{n}\xi_i s.t. yi(wTxi+b)1ξiy_i(w^Tx_i + b) \ge 1 - \xi_i。消去 ξi\xi_i 得等价无约束形式 minw12w2+Cimax(0,1yif(xi))\min_w \frac{1}{2}\Vert w\Vert^2 + C\sum_i \max(0, 1 - y_i f(x_i)), 其中 hinge loss max(0,1yf(x))\max(0, 1 - y f(x))0-10\text{-}1 损失的凸上界, 且 yf(x)1y f(x) \ge 1 时梯度为 0。超参数 CC 权衡间隔宽度与误分类惩罚: CC \to \infty 退化为硬间隔 (零容忍、易过拟合), C0C \to 0 忽略错分 (间隔最大、欠拟合)。
💡使用场景
面试常考 hinge loss 与对数损失的对比、CC 的偏差-方差解释、对偶中约束如何从 αi0\alpha_i \ge 0 变为 0αiC0 \le \alpha_i \le C
解决的核心痛点
硬间隔对单个离群点极其敏感 (一个越界点就能完全改写边界); 软间隔用 hinge 线性惩罚使边界鲁棒——hinge 只惩罚间隔内的样本 (yf(x)<1y f(x) < 1), 已正确且高置信的样本 (yf(x)1y f(x) \ge 1) 零梯度, 天然稀疏, 对比对数损失对全部样本连续惩罚; 对偶问题只需把约束换成盒式约束 0αiC0 \le \alpha_i \le C, 仍为凸 QP, 与核技巧无缝结合 (支持向量分为间隔上 0<αi<C0 < \alpha_i < C 与间隔内 αi=C\alpha_i = C 两类)。
🎯5 个高频面试考点 (Exam Points)
1
白板推导软间隔目标: 写出 min12w2+Ciξi\min \frac{1}{2}\Vert w\Vert^2 + C\sum_i \xi_i s.t. yi(wTxi+b)1ξi,ξi0y_i(w^Tx_i+b) \ge 1 - \xi_i, \xi_i \ge 0, 并消去 ξ\xi 化为 hinge 形式。
2
hinge loss max(0,1yf(x))\max(0, 1-yf(x)) 的性质: 为什么是 0-10\text{-}1 损失的凸上界, 为什么 yf(x)1yf(x) \ge 1 时梯度为 0, 不可微点如何处理?
3
CC 的偏差-方差权衡: CC \to \inftyC0C \to 0 分别对应什么行为, 如何用交叉验证选择 CC?
4
推导软间隔对偶中盒式约束 0αiC0 \le \alpha_i \le C 的由来 (对 ξi\xi_i 的拉格朗日乘子消元), 以及两类支持向量的含义。
5
hinge vs log loss 对比: 为什么 SVM 的解稀疏而 LR 不是? 两者对概率输出、异常值、重叠分布数据各有什么偏好?
📖 关联深度指南:📄 support-vector-machines
更新于 2026-08-12
🎯
检验攻克程度:针对「软间隔 C 与 Hinge」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点SVM 最大间隔与对偶下一个知识点核技巧与 RBF

🔗 更多 经典机器学习 知识点卡片

AdaBoost 算法手推Bagging 与随机森林HMM 参数学习 Baum-WelchGBDT 负梯度拟合