M2-015M2: Classical Machine LearningRegularization (L1 / L2)Medium
Mastery:
Regularization (L1 / L2): 解释早停(early stopping)为什么等价于某种正则化。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 限制参数从初始点出发的'有效搜索半径',与 L2 约束的可行域类似。
📌 Key Takeaways
- •用验证集早停 = 隐式正则
- •需设 patience 与监控指标
📐 Mathematical Derivations
等价性的直观论证:梯度下降的每步更新幅度为 η‖∇L‖,t 步后参数距初始点的距离被限制在 η·Σ‖∇L‖ 内——这等价于一个<strong>L2 约束的可行域</strong>(半径随步数增长)。因此'在验证误差开始上升时停止'与'限制参数范数'有相似的收缩效果。更严格的论证来自<strong>隐式正则</strong>视角:小学习率 + 有限步数的梯度下降倾向于收敛到<strong>平坦极小</strong>(flat minima),而平坦极小与更好的泛化相关(SAM 等工作即基于此)。此外,早停避免了显式正则化需要调 λ 的麻烦(用训练步数作为隐式正则强度),且计算成本只是评估验证集。
🏭 Production Trade-offs
实践要点:① <strong>patience 与监控指标</strong>——不能一看到验证误差上升就停(噪声波动会误判),通常设 patience=5–20 个 epoch;监控指标应与最终目标一致(如不平衡数据看 PR-AUC 而非 accuracy)。② <strong>与学习率调度的交互</strong>——cosine 衰减等调度会自然降低后期更新幅度,与早停有叠加效应;WSD(warmup-stable-decay)调度的 stable 阶段适合随时早停与分支实验。③ <strong>与显式正则的关系</strong>——两者可叠加但需协调:若已有强 weight decay,早停的额外收益减小;反之若数据少、模型大,早停是最简单有效的防线。④ <strong>陷阱</strong>——用测试集早停会泄漏(应严格用验证集);多次早停后报告最佳 epoch 的性能会有<strong>选择性偏差</strong>(需用独立测试集确认)。
⚠️ Common Interview Pitfalls
- ✕用测试集做早停(信息泄漏)
- ✕patience 设为 1(噪声波动导致过早停止)
🎯 Interviewer Follow-ups
- ?早停与学习率的关系?
- ?为什么早停能防止过拟合?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.