M3-068M3: Deep Learning FoundationsLoss Functions & ObjectivesHard
Mastery:

Loss Functions & Objectives: 什么是损失函数与评估指标错配?举例说明。

📐 Mathematical Definition
min⁡θ Lproxy ≠ max⁡θ Metricbusiness\min_\theta\ \mathcal{L}_{\text{proxy}}\ \ne\ \max_\theta\ \text{Metric}_{\text{business}}
⚡ Executive Summary
Core Concept: 训练用可微的代理损失、评估用业务指标,两者不一致会导致'训练变好但业务变差';用可微近似或排序对齐缓解。

📌 Key Takeaways

  • •
    分类常用 CE 训练但评估 F1/AUC/Recall@k
  • •
    检索用点式 CE 训练但评估排序指标(NDCG/MRR)
  • •
    生成用 MLE 训练但评估 BLEU/ROUGE/人工偏好

📐 Mathematical Derivations

数学机理:错配的根源是<strong>评估指标往往不可微或不连续</strong>,无法直接做梯度下降。典型例子:(1) <strong>分类</strong>——训练用 CE(可微),但业务关心 F1、Recall@k、AUC(涉及阈值/排序/计数,不可微);CE 优化的是概率校准,与 F1 的最优点不一致(尤其类别不平衡时)。(2) <strong>检索/排序</strong>——训练用 pointwise CE(每个样本独立算损失),但评估用 NDCG/MRR(依赖<strong>样本间的相对顺序</strong>);pointwise 训练无法感知排序结构,故常见'训练 loss 降但 NDCG 不涨'。(3) <strong>生成</strong>——训练用 MLE(teacher forcing 下的 token 级 CE),但评估用 BLEU/ROUGE 或人工偏好;MLE 的 exposure bias 与序列级目标的差距是核心问题。(4) <strong>回归</strong>——训练用 MSE,评估用 MAPE(相对误差),后者对大值不敏感、对小值敏感,最优点不同。<strong>缓解手段</strong>:(a) 用<strong>可微代理</strong>(如用 softmax 近似排序、用松弛化把离散指标变可微);(b) 用<strong>排序损失</strong>(pairwise/listwise)替代 pointwise,使其与 NDCG 对齐;(c) 用<strong>强化学习/序列级奖励</strong>(如 RLHF、BLEU 作为 reward 做 policy gradient);(d) 用<strong>两阶段</strong>(先 CE 预训练,再用指标导向的微调)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>AUC 为什么不能直接优化</strong>——AUC 是'正样本得分高于负样本'的概率,可写成 Σ_{i∈P,j∈N} 1[s_i>s_j]/(|P||N|),含不可微的指示函数;可用 <strong>pairwise ranking loss</strong>(如 logistic loss on score difference)作为可微上界来近似。② <strong>NDCG 的可微近似</strong>——用 softmax 近似排序位置(SoftRank、ApproxNDCG),或用 LambdaRank 的 λ 梯度(直接对 NDCG 求'交换两文档的增益差'作为梯度权重)。③ <strong>生成任务的错配</strong>——MLE 的 teacher forcing 与推理时的自回归解码不一致(exposure bias);序列级 RL(如 SCST、RLHF)用实际评估指标作 reward,直接优化序列级目标。④ <strong>RLHF 的本质</strong>——它正是'用人类偏好(不可微)作为目标'的通用解法:先学一个可微的奖励模型逼近人类偏好,再用 PPO 优化。这是'指标错配'问题最成功的工业案例。⑤ <strong>实践诊断</strong>——同时记录训练损失与业务指标;若二者走势背离,即错配信号。⑥ <strong>面试要点</strong>——被问'训练好但业务差',第一反应应是'检查训练目标与业务指标是否错配',并给出'可微代理 / 排序损失 / RL'三类解法;这是体现'业务导向思维'的高分回答。
⚠️ Common Interview Pitfalls
  • ✕
    只看训练 loss 判断模型好坏(可能与业务指标背离)
  • ✕
    用 pointwise 损失做排序任务(忽略样本间相对顺序)
🎯 Interviewer Follow-ups
  • ?
    为什么 AUC 不能直接作为损失优化?
  • ?
    如何用可微损失近似排序指标?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-067: Loss Functions & Objectives: 对比学习中的 InfoNCE 与 Triplet Loss 有何差异。📋Back to BankNext →M3-069: Loss Functions & Objectives: 解释 KL 散度在蒸馏/正则中的使用与它的不对称性。