M2-012M2: Classical Machine LearningRegularization (L1 / L2)Easy
Mastery:

Regularization (L1 / L2): 正则化系数 λ 如何选择?过大过小分别会怎样。

📐 Mathematical Definition
λ∗=arg⁡min⁡λ CV error(λ)\lambda^*=\arg\min_\lambda\ \text{CV error}(\lambda)
⚡ Executive Summary
Core Concept: 用交叉验证选择;λ 过大 → 欠拟合(高偏差),过小 → 过拟合(高方差)。

📌 Key Takeaways

  • •
    1SE 规则倾向更简单的模型
  • •
    用对数网格搜索

📐 Mathematical Derivations

λ 的作用是控制偏差-方差权衡:λ→0 时退化为无正则的 MLE(低偏差高方差,过拟合);λ→∞ 时所有系数收缩到 0(高偏差低方差,欠拟合)。选择方法是<strong>交叉验证</strong>:在对数尺度上网格搜索(如 λ∈{10⁻⁴,…,10⁴},通常 100 个点),对每个 λ 计算 K 折 CV 误差,取最小者。选择对数网格的原因:λ 的效应是乘性的(λ 与 2λ 的差异类似 100λ 与 200λ),且最优 λ 的量级跨越多个数量级。

🏭 Production Trade-offs

三个实践要点:① <strong>1SE 规则</strong>——不取 CV 误差最小的 λ,而取'误差在最小值 1 个标准误内的最大 λ',即更简单的模型。理由是 CV 误差曲线在最小值附近很平坦,而更大 λ 带来更好的泛化稳定性(Occam 剃刀);这在特征选择场景尤其重要(减少假阳性特征)。② <strong>λ 与数据的尺度相关</strong>——若特征未标准化,λ 的最优值会随量纲变化;因此标准化后再调 λ。③ <strong>嵌套 CV 的必要性</strong>——若用同一份数据既选 λ 又报告性能,会得到<strong>乐观偏差</strong>的估计(因为 λ 被选为对这份数据最优);正确做法是外层 CV 评估性能、内层 CV 选 λ。此外,正则化路径(λ 从大到小)的计算可用<strong>热启动</strong>(warm start)加速——坐标下降从上一个 λ 的解出发,使整条路径的计算成本接近单个 λ。
⚠️ Common Interview Pitfalls
  • ✕
    未标准化特征就调 λ
  • ✕
    用同一份 CV 结果既选 λ 又报告性能(乐观偏差)
🎯 Interviewer Follow-ups
  • ?
    为什么用 1SE 规则?
  • ?
    嵌套交叉验证解决什么问题?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-011: Regularization (L1 / L2): 比较 L1、L2 与 ElasticNet 正则化的几何与效果差异。📋Back to BankNext →M2-013: Regularization (L1 / L2): Dropout 为什么能起到正则化作用?给出两种解释。