M2-118M2: Classical Machine LearningEvaluation Metrics & Hyperparameter TuningMedium
Mastery:
Evaluation Metrics & Hyperparameter Tuning: 解释多指标权衡与综合指标(OEC)的设计。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 单一综合指标(OEC)便于决策但会掩盖局部;需配合护栏指标与分层分析。
📌 Key Takeaways
- •综合指标使决策唯一化(避免 p-hacking)
- •权重反映业务优先级,需预先确定
📐 Mathematical Derivations
问题的背景:实验或模型评估通常有<strong>多个指标</strong>(如点击、转化、停留、退货、延迟),它们可能<strong>方向相反</strong>(提升点击但增加退货)。若不做综合,会出现两种问题:① <strong>多重比较</strong>——同时看 20 个指标并只报显著的,假阳性率极高(p-hacking);② <strong>决策困难</strong>——'点击涨 2% 但退货涨 3%'无法直接判断好坏。<strong>OEC(Overall Evaluation Criterion)</strong> 的解法是把多个指标加权合成为<strong>单一目标</strong>:OEC=Σwₖ·normalized(metricₖ),其中 normalization(如 z-score、相对变化、或按业务价值折算为货币)使不同量纲可比,wₖ 反映业务优先级。<strong>设计原则</strong>:① <strong>权重预先确定</strong>——必须在看数据前定好(否则事后调权重就是 p-hacking);② <strong>归一化方式明确</strong>——常用'相对变化百分比'或'折算为统一货币单位';③ <strong>只纳入可权衡的指标</strong>——护栏指标(不能牺牲的底线)应<strong>排除在 OEC 之外</strong>,单独设阈值。
🏭 Production Trade-offs
护栏指标(guardrail metrics)的设计:① <strong>定义</strong>——不能因优化主指标而牺牲的底线指标(如延迟 P99、错误率、退货率、投诉率、公平性指标);② <strong>使用方式</strong>——设<strong>硬阈值</strong>(如 P99 延迟不得超过 200ms),一旦突破则实验判定失败(无论 OEC 如何);③ <strong>选择依据</strong>——(a) 用户体验底线(延迟、崩溃率);(b) 长期健康(留存、退货、生态多样性);(c) 合规与公平(不同群体的性能差异)。<strong>实践要点</strong>:① <strong>OEC vs 多指标并列</strong>——OEC 适合'有明确业务加权'的场景;若无明确权重,可报告<strong>多个主指标</strong>并明确决策规则(如'主指标提升且所有护栏不劣化');② <strong>分层分析</strong>——OEC 提升可能是由某一人群驱动(其他人群受损),应做<strong>分层检查</strong>(按用户等级、地区、新老用户);③ <strong>长期指标</strong>——短期 OEC 可能与长期冲突(见'长期效应评估'题),应同时监控长期指标;④ <strong>指标数量控制</strong>——OEC 中的指标不宜过多(3–5 个),过多会使权重难以确定且掩盖细节;⑤ <strong>敏感性分析</strong>——报告 OEC 对不同权重方案的敏感性(结论是否稳健);⑥ <strong>常见错误</strong>——(a) 事后调权重;(b) 把护栏指标纳入 OEC(可被牺牲);(c) 不做归一化直接相加(量纲不同导致某一指标主导);(d) 只报 OEC 不报各分项(无法诊断)。
⚠️ Common Interview Pitfalls
- ✕事后调整 OEC 权重(p-hacking)
- ✕把护栏指标纳入 OEC(可被牺牲)
🎯 Interviewer Follow-ups
- ?为什么不能只优化单一指标?
- ?如何设计护栏指标?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.