M3-051M3: Deep Learning FoundationsRegularization & Training TricksHard
Mastery:

Regularization & Training Tricks: 什么是参数平均(SWA)与模型融合?

📐 Mathematical Definition
θSWA=1k∑i=1kθi;y^=1k∑i=1kfi(x) (ensemble)\theta_{\text{SWA}}=\frac1k\sum_{i=1}^{k}\theta_i;\qquad \hat y=\frac1k\sum_{i=1}^{k}f_i(x)\ (\text{ensemble})
⚡ Executive Summary
Core Concept: SWA 对轨迹上多点做等权平均,偏向平坦解;模型融合(checkpoint averaging / 集成)平均多个模型的预测或权重。

📌 Key Takeaways

  • •
    SWA 需周期性高 lr 使采样点分散
  • •
    权重平均要求模型在同一'损失盆地'(否则有害)
  • •
    预测集成(ensemble)总比权重平均更稳但更贵

📐 Mathematical Derivations

数学机理:<strong>SWA(Izmailov 等 2018)</strong> 的做法是在训练后期<strong>周期性</strong>地把 lr 拉高(如循环或固定高 lr),使参数在不同时间落在损失盆地内<strong>不同但相近</strong>的位置,然后对这些点做<strong>等权平均</strong>。理论依据:若这些点都在同一平坦盆地内,则它们的平均仍在盆地内且<strong>更接近盆地中心</strong>(平坦解),而平坦解的泛化通常更好;反之若各点落在不同盆地,平均点会落在'盆地之间的高损失脊'上,性能崩塌。<strong>模型融合</strong>有两个层次:<strong>(a) 权重平均</strong>(需同盆地、且通常需重新估计 BN 统计——因为平均后的权重对应新的激活分布,BN 的 running mean/var 必须重新跑一遍数据);<strong>(b) 预测集成</strong>——保留多个模型分别推理再平均输出,不要求同盆地、效果最稳,但推理成本 ×k。<strong>checkpoint averaging</strong> 是 SWA 的实用变体:对训练最后几个 epoch 的 checkpoint 做平均。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>为什么需要重估 BN</strong>——BN 的 running statistics 依赖于当前权重的激活分布;权重平均后分布改变,若不重估,推理时归一化失配、性能显著下降。SWA 论文明确指出需'BN update pass'(用训练数据跑一遍前向更新统计)。② <strong>SWA vs EMA</strong>——EMA 是'时间加权、单条轨迹',SWA 是'等权、周期性多采样点';EMA 更简单通用,SWA 在需要显式找平坦解时更有效。两者可叠加。③ <strong>在 LLM 中的现实</strong>——权重平均在 LLM 中较少用(不同 checkpoint 常落在不同盆地,且成本高);<strong>预测集成</strong>在 LLM 中用于提升质量(如 self-consistency 采样多个答案投票),但那是解码层面的集成而非权重层面。④ <strong>融合的实用价值</strong>——模型融合(ensemble)是竞赛提升精度的可靠手段(通常提升 1~3%),代价是推理成本;生产环境更常用<strong>知识蒸馏</strong>把集成压缩回单模型。⑤ <strong>与 LoRA 的交互</strong>——多个 LoRA 适配器可通过权重平均合并(task arithmetic / model soup),但需注意不同任务的适配器可能落在不同盆地,平均可能失效。⑥ <strong>面试要点</strong>——被问'能否把两个模型权重平均',正确回答:'只有当它们在同一损失盆地内才有效;否则应在预测层集成',并提到 BN 重估这一必要步骤。
⚠️ Common Interview Pitfalls
  • ✕
    无条件平均两个独立训练的模型权重(不同盆地→崩塌)
  • ✕
    权重平均后不重估 BN 统计
🎯 Interviewer Follow-ups
  • ?
    为什么权重平均要求模型在同一盆地?
  • ?
    SWA 与 EMA 的本质区别是什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-050: Regularization & Training Tricks: 解释 EMA(指数移动平均)在训练中的作用。📋Back to BankNext →M3-052: Regularization & Training Tricks: 解释 label smoothing 的作用与代价。