M8-081M8: ML Systems, Engineering & ResearchResearch: Experiment Design & AblationsMedium
Mastery:

Research: Experiment Design & Ablations: 如何处理实验中的方差来源?

📐 Mathematical Definition
var=seed+split+order+hardware;report xˉ±s\text{var}=\text{seed}+\text{split}+\text{order}+\text{hardware};\qquad \text{report}\ \bar x\pm s
⚡ Executive Summary
Core Concept: 方差来自随机初始化、数据划分、批顺序与硬件非确定性;用多个随机种子、固定划分、报告方差、以及配对比较来降噪并给出可信结论。

📌 Key Takeaways

  • •
    随机初始化——权重初始化不同导致结果波动,需多随机种子
  • •
    数据划分——训练/验证/测试划分不同影响评估,需固定划分或交叉验证
  • •
    训练随机性——批顺序、dropout、数据增强的随机性
  • •
    硬件非确定性——不同 GPU/算子归约顺序导致数值差异
  • •
    降噪手段——多种子取均值、固定划分、配对比较、报告标准差

📐 Mathematical Derivations

数学机理:<strong>方差来源与处理</strong>——(1) <strong>随机种子(seed)</strong>——(a) <strong>来源</strong>——权重初始化、dropout 掩码、数据洗牌、数据增强;(b) <strong>影响</strong>——同一方法不同种子性能可差 1-3 个点;(c) <strong>处理</strong>——跑多个种子(≥3-5),报告均值 ± 标准差;<strong>关键</strong>——用配对种子(同一组种子跑所有方法)。(2) <strong>数据划分(split)</strong>——(a) <strong>来源</strong>——训练/验证/测试的划分方式;(b) <strong>影响</strong>——评估集不同导致指标不可比;(c) <strong>处理</strong>——<strong>固定划分</strong>(所有方法用同一划分)或<strong>交叉验证</strong>(k 折报告均值);(d) <strong>注意</strong>——若各方法用不同划分,比较无意义。(3) <strong>训练随机性(order)</strong>——(a) 批顺序、采样顺序;(b) 影响训练轨迹;(c) 处理——固定种子或报告多种子均值。(4) <strong>硬件非确定性(hardware)</strong>——(a) 不同 GPU 架构的浮点归约顺序不同;(b) 影响——1e-6 级差异,长训练可放大;(c) 处理——记录硬件;追求逐位一致时用确定性算子。(5) <strong>降噪与报告</strong>——(a) <strong>多种子均值 ± 标准差</strong>——最基本要求;(b) <strong>配对比较</strong>——同种子/同划分下比较,消除共同方差;(c) <strong>置信区间</strong>——给出差异的不确定性;(d) <strong>箱线图/误差棒</strong>——可视化分布。(6) <strong>区分真实提升与噪声</strong>——(a) <strong>判断</strong>——差异是否 > 种子间方差;(b) <strong>检验</strong>——配对 t 检验 / 置信区间是否排除 0;(c) <strong>实践</strong>——若提升小于种子噪声,不可信。(7) <strong>成本权衡</strong>——(a) 多种子/交叉验证成本高(k 倍);(b) <strong>策略</strong>——关键结论用多种子,探索性实验可单次;(c) 大模型训练成本高时,用较小规模做多种子,大模型做少量种子。(8) <strong>实验记录</strong>——(a) 记录种子、划分、硬件;(b) 可复现;(c) 报告中明确方差来源与处理方式。<strong>与其他问题的关系</strong>——(a) 与显著性检验(配对与方差);(b) 与消融实验(报告方差);(c) 与可复现性。<strong>度量</strong>——(a) 种子间标准差;(b) 提升是否超过方差;(c) 配对检验的 p 值。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>不同种子的性能差异常被忽略</strong>——可达 1-3 个点;面试中能指出这点是深度理解的标志。② <strong>固定数据划分是可比性的前提</strong>——各方法用不同划分则比较无意义。③ <strong>配对比较消除共同方差</strong>——提高统计功效。④ <strong>硬件非确定性影响逐位复现</strong>——但通常不影响结论。⑤ <strong>提升必须大于方差才可信</strong>——否则是噪声。⑥ <strong>多种子成本高</strong>——需按重要性权衡。⑦ <strong>面试要点</strong>——被问怎么处理实验方差,应给出'<strong>多种子报告均值±标准差 + 固定划分 + 配对比较 + 置信区间 + 判断提升是否超过方差 + 记录种子/硬件</strong>';能指出固定划分是可比性前提与配对比较是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    单次运行就下结论
  • ✕
    各方法用不同数据划分还直接比较
🎯 Interviewer Follow-ups
  • ?
    为什么不同随机种子会导致指标差异?
  • ?
    如何区分'真实提升'与'种子噪声'?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-080: Research: Experiment Design & Ablations: 如何做显著性检验与效应量报告?📋Back to BankNext →M8-082: Research: Experiment Design & Ablations: 如何避免'调参偏向自己方法'的偏差?