M3-086M3: Deep Learning FoundationsTraining Diagnostics & DebuggingEasy
Mastery:

Training Diagnostics & Debugging: 训练 loss 下降但验证 loss 上升,说明什么?怎么办。

📐 Mathematical Definition
generalization gap=Lval−Ltrain ↑ ⇒ overfitting\text{generalization gap}=\mathcal{L}_{\text{val}}-\mathcal{L}_{\text{train}}\ \uparrow\ \Rightarrow\ \text{overfitting}
⚡ Executive Summary
Core Concept: 典型过拟合:模型记住训练集但泛化差;对策是加正则、增数据、减容量、早停、数据增强。

📌 Key Takeaways

  • •
    训练降、验证升 = 过拟合(泛化间隙扩大)
  • •
    对策:数据增强/增数据、正则、减容量、早停
  • •
    也可能是分布偏移(验证集与训练集分布不同)

📐 Mathematical Derivations

数学机理:<strong>过拟合</strong>的定义是'模型在训练分布上表现好、在未见数据上表现差',表现为训练 loss 持续下降而验证 loss 先降后升(泛化间隙扩大)。<strong>成因</strong>是模型容量(参数/有效自由度)相对于数据量过大,使其能'记住'训练样本的噪声而非学习真实模式。<strong>偏差-方差分解</strong>给出视角:过拟合对应<strong>方差项</strong>主导——模型对训练集的扰动过于敏感。<strong>对策的机理</strong>:(a) <strong>增加数据</strong>——直接降低方差(最根本,因为方差 ∝1/n);(b) <strong>数据增强</strong>——等价于扩大有效数据分布(注入'这些变换不改变标签'的先验);(c) <strong>正则化</strong>——权重衰减、dropout、label smoothing 等限制有效容量;(d) <strong>减小模型</strong>——直接降容量(但可能增偏差);(e) <strong>早停</strong>——在验证 loss 最低点停止,相当于隐式正则(限制参数离开初始点太远);(f) <strong>集成/EMA</strong>——降低预测方差。<strong>但需先排除另一种可能</strong>:若<strong>验证集与训练集分布不同</strong>(如时间上未来数据、不同人群),则'训练降、验证升'是<strong>分布偏移</strong>而非过拟合,此时加正则无效、需重采样或领域自适应。区分方法:检查验证集与训练集的特征分布(如均值、分位数),或用'训练集内部的留出验证'(若留出集上表现好,说明是分布偏移)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>优先级</strong>——'增数据 > 数据增强 > 正则 > 减容量';因为正则只是'用偏差换方差',而数据直接降方差、不增偏差。这也是大模型'数据为王'的原因。② <strong>正则的边际收益递减</strong>——叠加多种正则收益递减且相互影响;建议逐个调、观察验证曲线。③ <strong>现代大模型的反例</strong>——LLM 预训练在'数据远多于参数量'时几乎不过拟合(训练 loss 持续降、验证 loss 同步降),故不用 dropout;这提醒我们'过拟合是数据-容量比的问题',而非绝对现象。④ <strong>分布偏移的常见场景</strong>——推荐/风控中的时间漂移、跨域迁移、样本选择偏差(训练集来自线上曝光、验证集来自随机流量);对策是'时间上切分验证集'与'逆概率加权'。⑤ <strong>诊断工具</strong>——画'训练 vs 验证 loss 曲线'、'学习曲线'(不同数据量下的表现)、'训练集与验证集的特征分布对比';这些能区分过拟合与分布偏移。⑥ <strong>面试要点</strong>——被问'loss 曲线这样说明什么',应先答'典型过拟合',但<strong>主动补充</strong>'需先排除分布偏移',并给出区分方法——这个补充是区分'背概念'与'有实战经验'的关键。
⚠️ Common Interview Pitfalls
  • ✕
    把所有'验证 loss 上升'都归为过拟合(可能是分布偏移)
  • ✕
    只加正则不检查数据分布与数据量
🎯 Interviewer Follow-ups
  • ?
    如何区分过拟合与分布偏移?
  • ?
    为什么增加数据比加正则更根本?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-085: Training Diagnostics & Debugging: 训练 loss 不下降,你会按什么顺序排查?📋Back to BankNext →M3-087: Training Diagnostics & Debugging: 解释 loss 曲线中常见的三种异常形态及其原因。