返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-loss-function-taxonomy

常见损失函数选型与梯度特性

Loss Function Taxonomy & Gradients
🎯核心定义
损失函数选型与梯度特性体系 (Loss Function Taxonomy & Gradient Dynamics) 是机器学习工程师针对不同任务类型(回归、二分类、多分类、排序、对比学习)与数据噪声分布,设计最优监督目标与梯度下降动力的核心理论库;核心损失函数族:1) 回归任务:MSE (L2: 对大误差惩罚极强易受异常值影响)、MAE (L1: 鲁棒但 0 点不可导)、Huber Loss (分段平滑过渡结合 L1/L2 优点);2) 分类任务:Binary Cross-Entropy (二分类对数损失)、Categorical Cross-Entropy (多分类配 Softmax)、Focal Loss (针对极端不平衡,动态抑制易分样本梯度);3) 度量与对比学习:Triplet Loss (三元组边际损失)、InfoNCE (基于温度系数的对比交叉熵)。
💡使用场景
工业级模型目标函数设计、异常值鲁棒性调优、样本不平衡惩罚定制与多任务联合损失加权。
解决的核心痛点
盲目套用 MSE 会因脏数据离群点导致梯度爆炸,标准交叉熵在 1:10000 稀疏样本下会产生梯度掩蔽;科学的损失函数选型提供了抗噪、凸优化收敛与业务目标无偏差对齐。
🎯5 个高频面试考点 (Exam Points)
1
推导交叉熵损失函数对 Softmax 输入 Logits ziz_i 的导数:Lzi=piyi\frac{\partial \mathcal{L}}{\partial z_i} = p_i - y_i,并解释其简洁的“预测概率减去真实标签”物理意义?
2
对比 Huber Loss 与 Smooth L1 Loss 在目标检测与回归任务中的数学公式与一阶导数连续性?
3
Focal Loss 中调节因子 (1pt)γ(1 - p_t)^\gamma 如何动态抑制已分类良好样本的梯度(当 pt=0.99p_t=0.99 时梯度衰减 1000 倍)?
4
InfoNCE 损失函数中温度系数 τ\tau (Temperature) 的作用:如何平衡难负例区分度与特征崩塌 (Representation Collapse)?
5
标签平滑 (Label Smoothing Cross-Entropy: ysmooth=(1ϵ)y+ϵKy_{\text{smooth}} = (1 - \epsilon) y + \frac{\epsilon}{K}) 在防止模型过度自信与过拟合中的数学机理?
🔗核心前置底层技术卡片 (点击穿透复习)
📖 关联深度指南:📄 mle-core-cheatsheet
更新于 2026-08-14
🎯
检验攻克程度:针对「常见损失函数选型与梯度特性」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点偏差-方差权衡与过拟合诊断下一个知识点优化器收敛性与动量选型准则

🔗 更多 MLE 工程师 知识点卡片

模型集成 Stacking 与 Blending模型压缩、剪枝与量化基础手撕 Multi-Head Self-Attention手写 Softmax 防溢出与 Cross-Entropy