M2-012M2: Classical Machine LearningRegularization (L1 / L2)Easy
Mastery:
Regularization (L1 / L2): 正则化系数 λ 如何选择?过大过小分别会怎样。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用交叉验证选择;λ 过大 → 欠拟合(高偏差),过小 → 过拟合(高方差)。
📌 Key Takeaways
- •1SE 规则倾向更简单的模型
- •用对数网格搜索
📐 Mathematical Derivations
λ 的作用是控制偏差-方差权衡:λ→0 时退化为无正则的 MLE(低偏差高方差,过拟合);λ→∞ 时所有系数收缩到 0(高偏差低方差,欠拟合)。选择方法是<strong>交叉验证</strong>:在对数尺度上网格搜索(如 λ∈{10⁻⁴,…,10⁴},通常 100 个点),对每个 λ 计算 K 折 CV 误差,取最小者。选择对数网格的原因:λ 的效应是乘性的(λ 与 2λ 的差异类似 100λ 与 200λ),且最优 λ 的量级跨越多个数量级。
🏭 Production Trade-offs
三个实践要点:① <strong>1SE 规则</strong>——不取 CV 误差最小的 λ,而取'误差在最小值 1 个标准误内的最大 λ',即更简单的模型。理由是 CV 误差曲线在最小值附近很平坦,而更大 λ 带来更好的泛化稳定性(Occam 剃刀);这在特征选择场景尤其重要(减少假阳性特征)。② <strong>λ 与数据的尺度相关</strong>——若特征未标准化,λ 的最优值会随量纲变化;因此标准化后再调 λ。③ <strong>嵌套 CV 的必要性</strong>——若用同一份数据既选 λ 又报告性能,会得到<strong>乐观偏差</strong>的估计(因为 λ 被选为对这份数据最优);正确做法是外层 CV 评估性能、内层 CV 选 λ。此外,正则化路径(λ 从大到小)的计算可用<strong>热启动</strong>(warm start)加速——坐标下降从上一个 λ 的解出发,使整条路径的计算成本接近单个 λ。
⚠️ Common Interview Pitfalls
- ✕未标准化特征就调 λ
- ✕用同一份 CV 结果既选 λ 又报告性能(乐观偏差)
🎯 Interviewer Follow-ups
- ?为什么用 1SE 规则?
- ?嵌套交叉验证解决什么问题?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.