M8-084M8: ML Systems, Engineering & ResearchResearch: Experiment Design & AblationsMedium
Mastery:

Research: Experiment Design & Ablations: 如何设计公平的对比协议?

📐 Mathematical Definition
protocol=(data,budget,search space,eval,seeds,pre-registration)\text{protocol}=(\text{data},\text{budget},\text{search space},\text{eval},\text{seeds},\text{pre-registration})
⚡ Executive Summary
Core Concept: 固定数据划分与预处理、给所有方法相同的训练预算与调参搜索空间、使用相同评估脚本、跑多个随机种子,并在实验前预注册假设以避免选择性报告。

📌 Key Takeaways

  • •
    数据——相同划分、相同预处理与增强、相同数据量
  • •
    预算——相同训练步数/epoch、相同调参预算、相同算力
  • •
    搜索空间——各方法各自的合理超参范围,相同搜索算法与 trials 数
  • •
    评估——相同指标、相同评估脚本、相同测试集(只用于最终报告)
  • •
    种子与预注册——多随机种子配对比较;实验前定好协议与假设

📐 Mathematical Derivations

数学机理:<strong>公平对比协议(fair comparison protocol)</strong>——(1) <strong>数据一致</strong>——(a) <strong>相同划分</strong>——训练/验证/测试划分对所有方法一致(固定划分或相同交叉验证折);(b) <strong>相同预处理</strong>——归一化、增强、分词、截断一致;(c) <strong>相同数据量</strong>——不给自己方法更多数据;(d) <strong>注意</strong>——若方法本身需要额外数据(如预训练),需明确说明并单独比较。(2) <strong>预算一致</strong>——(a) <strong>训练预算</strong>——相同步数/epoch/算力;(b) <strong>调参预算</strong>——相同超参搜索次数/GPU 小时;(c) <strong>理由</strong>——预算不均会导致'调参更多'的方法虚胜。(3) <strong>搜索空间</strong>——(a) <strong>各方法各自的合理范围</strong>——而非强行统一超参值(不同方法有不同超参);(b) <strong>相同搜索算法</strong>——网格/随机/贝叶斯一致;(c) <strong>相同 trials 数</strong>——搜索预算对齐;(d) <strong>澄清</strong>——'相同搜索空间'指<strong>相同搜索预算与协议</strong>,不是相同超参值。(4) <strong>评估一致</strong>——(a) 相同指标(定义与实现);(b) 相同评估脚本(避免实现差异);(c) 相同测试集,<strong>只用于最终报告</strong>;(d) 报告完整结果(含不利指标)。(5) <strong>种子与统计</strong>——(a) 多随机种子(≥3-5),配对比较(同种子跑所有方法);(b) 报告均值 ± 标准差与置信区间;(c) 显著性检验。(6) <strong>预注册(pre-registration)</strong>——(a) <strong>做法</strong>——实验前写下假设、指标、样本量/种子数、分析计划、成功判据;(b) <strong>作用</strong>——防止事后挑选(HARKing:把事后发现包装成假设)、p-hacking(反复分析直到显著)、选择性报告;(c) <strong>在 ML</strong>——定好协议、种子、评估指标。(7) <strong>透明与可复现</strong>——(a) 公开代码与配置;(b) 报告所有方法的关键设置;(c) 记录硬件与环境;(d) 允许他人复现。(8) <strong>常见不公平</strong>——(a) 弱 baseline(未调优);(b) 预算不均(新方法调参多);(c) 数据不均;(d) 实现不均(自己方法工程优化更多);(e) 评估不均(只报有利指标);(f) 种子挑选(只报最好种子);(g) 测试集泄漏(反复试配置)。<strong>与其他问题的关系</strong>——(a) 与确定 baseline;(b) 与避免调参偏向;(c) 与消融实验;(d) 与功效分析。<strong>度量</strong>——(a) 数据/预算/评估/种子是否一致;(b) 是否有预注册;(c) 报告是否完整。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>预注册是防选择性报告的利器</strong>——面试中能指出这点是深度理解的标志。② <strong>预算一致涵盖训练与调参</strong>——两者都要对齐。③ <strong>'相同搜索空间'指相同预算与协议</strong>——不是相同超参值(易混淆)。④ <strong>实现一致也重要</strong>——自己方法工程优化更多会造成假胜。⑤ <strong>测试集只用于最终报告</strong>——反复使用是泄漏。⑥ <strong>透明与可复现是底线</strong>。⑦ <strong>面试要点</strong>——被问怎么保证公平对比,应给出'<strong>数据一致 + 预算一致(训练与调参)+ 相同搜索协议 + 评估一致 + 多种子配对 + 预注册 + 透明可复现</strong>';能指出预注册的作用与'相同搜索空间'的正确含义是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    把'相同搜索空间'误解为'相同超参值'
  • ✕
    无预注册(事后挑指标与结果)
🎯 Interviewer Follow-ups
  • ?
    为什么'相同搜索空间'不等于'相同超参值'?
  • ?
    预注册如何防止选择性报告?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-083: Research: Experiment Design & Ablations: 如何做统计功效分析与样本量估计?📋Back to BankNext →M8-085: Research: Replication & Debugging: 复现他人结果失败时,你会怎么排查?