M8-079M8: ML Systems, Engineering & ResearchResearch: Experiment Design & AblationsEasy
Mastery:
Research: Experiment Design & Ablations: 如何确定实验的 baseline?
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: baseline 应包含经典方法、当前 SOTA 与同预算的强工程实现;弱 baseline 会让增益虚高,只有与强 baseline 公平比较才能证明贡献。
📌 Key Takeaways
- •经典方法——领域内的标准方法(如 ResNet/BM25/Transformer),提供参照系
- •当前 SOTA——已发表的最优方法(或强开源实现),证明相对前沿的位置
- •同预算强实现——用相同数据与算力调优的最强方案,避免'新方法调得好、baseline 没调'
- •公平协议——相同数据划分、预处理、评估脚本与调参预算
- •简单基线——线性/启发式/随机,确认任务本身有难度(避免复杂模型无意义)
📐 Mathematical Derivations
数学机理:<strong>baseline 的层次与作用</strong>——(1) <strong>简单基线(trivial baselines)</strong>——(a) <strong>随机</strong>——随机预测(下界);(b) <strong>多数类/均值</strong>——最朴素策略;(c) <strong>启发式/规则</strong>——领域经验规则;(d) <strong>作用</strong>——确认任务难度与指标尺度(避免'95% 准确率'其实多数类就有 94%)。(2) <strong>经典方法</strong>——(a) 领域标准方法(ResNet、BM25、TF-IDF、LightGBM);(b) <strong>作用</strong>——提供历史参照,判断新方法是否超越已知方法。(3) <strong>当前 SOTA</strong>——(a) 已发表最优或强开源实现(如官方 repo);(b) <strong>作用</strong>——证明相对前沿的贡献;(c) <strong>注意</strong>——SOTA 论文可能未开源,需用可信复现或官方代码。(4) <strong>同预算强实现(strong same-budget baseline)</strong>——(a) <strong>定义</strong>——用与新方法<strong>相同的数据、算力、调参预算</strong>调优的基线;(b) <strong>作用</strong>——排除'新方法因调参多而胜出'的假象;(c) <strong>关键</strong>——这是公平比较的核心;(d) <strong>例</strong>——若新方法用了 100 组超参搜索,baseline 也应搜 100 组。(5) <strong>公平协议</strong>——(a) <strong>数据</strong>——相同划分、相同预处理、相同增强;(b) <strong>评估</strong>——相同指标与脚本;(c) <strong>调参</strong>——相同搜索空间与预算;(d) <strong>训练</strong>——相同步数/epoch 预算。(6) <strong>常见陷阱</strong>——(a) <strong>弱 baseline</strong>——与老旧/未调优方法比 → 增益虚高;(b) <strong>不对等预算</strong>——新方法调参多;(c) <strong>不同数据</strong>——baseline 用了更少数据;(d) <strong>选择性报告</strong>——只报对己有利的指标;(e) <strong>忽略成本</strong>——新方法更贵却只报精度。(7) <strong>选择策略</strong>——(a) <strong>按任务定</strong>——分类用经典+GBDT+深度模型;检索用 BM25+DPR+SOTA;(b) <strong>按资源定</strong>——若算力有限,用官方代码复现 SOTA;(c) <strong>诚实</strong>——若无法复现 SOTA,明确说明并解释。(8) <strong>报告</strong>——(a) 列出所有 baseline 及其配置;(b) 说明调参预算;(c) 报告相对与绝对增益;(d) 报告成本(算力/延迟)。<strong>与其他问题的关系</strong>——(a) 与消融实验;(b) 与公平对比协议;(c) 与判断论文可信度。<strong>度量</strong>——(a) baseline 覆盖层次(简单/经典/SOTA/同预算);(b) 调参预算一致性;(c) 增益的绝对量与成本。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>同预算强实现是最关键的 baseline</strong>——排除调参不均导致的假胜;面试中能指出这点是深度理解的标志。② <strong>简单基线确认任务难度</strong>——避免复杂模型解决一个平凡问题。③ <strong>弱 baseline 是虚高增益的主因</strong>。④ <strong>SOTA 难以复现时需诚实说明</strong>——不能假装超越。⑤ <strong>公平协议涵盖数据/评估/调参/训练</strong>。⑥ <strong>需报告成本</strong>——不只报精度。⑦ <strong>面试要点</strong>——被问怎么选 baseline,应给出'<strong>简单基线(确认难度)+ 经典方法 + 当前 SOTA + 同预算强实现 + 公平协议(数据/评估/调参)+ 报告成本</strong>';能指出同预算强实现是关键与简单基线的作用是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕只与弱 baseline 比较
- ✕新方法调参多而 baseline 不调参
🎯 Interviewer Follow-ups
- ?为什么必须包含'同预算强实现'作为 baseline?
- ?简单基线(如随机/多数类)有什么用?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.