M2-086M2: Classical Machine LearningEvaluation Metrics & Hyperparameter TuningEasy
Mastery:

Evaluation Metrics & Hyperparameter Tuning: 列举分类、回归、排序的常用评估指标。

📐 Mathematical Definition
F1=2PRP+R,RMSE=1n∑(y−y^)2F_1=\frac{2PR}{P+R},\qquad \mathrm{RMSE}=\sqrt{\frac1n\sum(y-\hat y)^2}
⚡ Executive Summary
Core Concept: 分类:Accuracy/P/R/F1/AUC/PR-AUC/LogLoss;回归:MSE/MAE/RMSE/R²/分位数损失;排序:NDCG/MRR/MAP/Recall@K。

📌 Key Takeaways

  • •
    指标要与业务目标一致
  • •
    不平衡看 PR-AUC;排序看 NDCG

📐 Mathematical Derivations

三类指标的要点:<strong>分类</strong>——① <strong>Accuracy</strong>:仅在类别平衡时有意义;② <strong>Precision/Recall</strong>:分别关注'预测为正的准确性'与'真实正类的覆盖率',需按业务取舍;③ <strong>F1</strong>:两者的<strong>调和平均</strong>(惩罚极端值,比算术平均更严格);④ <strong>AUC-ROC</strong>:阈值无关的排序质量,但在不平衡下过于乐观;⑤ <strong>PR-AUC</strong>:不平衡下更敏感;⑥ <strong>LogLoss(交叉熵)</strong>:评估概率质量(proper scoring rule),对过度自信惩罚强。<strong>回归</strong>——① <strong>MSE/RMSE</strong>:对大误差敏感(平方),与高斯噪声假设对应;② <strong>MAE</strong>:对异常值鲁棒(线性),对应 Laplace 噪声;③ <strong>R²</strong>:1−SSE/SST,表示解释的方差比例,可为负(模型比'预测均值'还差);④ <strong>分位数损失</strong>:预测分位数(如 P90 延迟)时使用;⑤ <strong>MAPE</strong>:相对误差,但对接近 0 的真值不稳定。<strong>排序</strong>——① <strong>Recall@K</strong>:top-K 中的相关项占比(召回视角);② <strong>MRR</strong>:第一个相关项排名的倒数均值(关注首位);③ <strong>NDCG@K</strong>:考虑相关性等级与位置折扣(最全面);④ <strong>MAP</strong>:平均精度(考虑所有相关项的位置)。

🏭 Production Trade-offs

指标选择的实践要点:① <strong>与业务目标对齐</strong>——这是第一原则:若业务关心'不漏掉任何欺诈',主指标应是 Recall(或固定 Precision 下的 Recall);若关心'推荐的点击率',用 CTR/AUC;若关心'用户找到东西的速度',用 MRR。② <strong>不要用 accuracy 处理不平衡</strong>——多数类占比 99% 时全预测多数类就有 99% 准确率;改用 PR-AUC、F1、balanced accuracy 或 MCC。③ <strong>MSE vs MAE 的选择</strong>——MSE 对大误差敏感(适合'大误差代价高'的场景,如金融风险);MAE 对异常值鲁棒(适合数据含噪的场景);Huber 是折中。④ <strong>R² 的解读</strong>——R²<0 说明模型比'直接用均值预测'还差(严重欠拟合或数据划分问题);R² 随特征增加而虚高(需用调整 R²)。⑤ <strong>排序指标的选择</strong>——若只关心首位(如自动补全)用 MRR;若关心整体排序质量用 NDCG;若关心覆盖用 Recall@K。⑥ <strong>多指标报告</strong>——单一指标易被优化(Goodhart 定律),应同时报告多个指标 + 业务指标 + 护栏指标。
⚠️ Common Interview Pitfalls
  • ✕
    在不平衡数据上用 accuracy 作为主指标
  • ✕
    只看离线指标而不与业务目标对齐
🎯 Interviewer Follow-ups
  • ?
    MAE 与 MSE 的取舍?
  • ?
    为什么 R² 可能为负?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-085: Model Calibration: 校准在哪些场景至关重要?举两个例子。📋Back to BankNext →M2-087: Evaluation Metrics & Hyperparameter Tuning: 比较网格搜索、随机搜索与贝叶斯优化。