M2-006M2: Classical Machine LearningLogistic Regression & GLMEasy
Mastery:
Logistic Regression & GLM: 写出逻辑回归的模型形式与损失函数。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: sigmoid 输出概率,用交叉熵(对数似然)训练;是 GLM 中 Bernoulli + logit 链接。
📌 Key Takeaways
- •线性决策边界(特征空间)
- •没有闭式解,用梯度/牛顿/IRLS
📐 Mathematical Derivations
模型与损失:逻辑回归假设 log(p/(1−p))=wᵀx(logit 是线性的),反解得 p=σ(wᵀx)=1/(1+e^{−wᵀx})。损失来自<strong>极大似然</strong>:对 N 个样本,负对数似然为 −Σ[yᵢlog pᵢ+(1−yᵢ)log(1−pᵢ)],即二元交叉熵。关键性质是<strong>梯度极其简洁</strong>:∇_w L=Σᵢ(pᵢ−yᵢ)xᵢ=Xᵀ(p−y)——这与线性回归的梯度 Xᵀ(Xw−y) 形式一致,只是把 Xw 换成 σ(Xw)。这个简洁性来自 sigmoid 导数 σ'=σ(1−σ) 与交叉熵的巧妙配合(链式法则中的分母被约掉),这也是为什么<strong>不用 MSE + sigmoid</strong>:后者的梯度含 σ' 因子,在饱和区趋近 0,导致梯度消失。
🏭 Production Trade-offs
两个实践要点:① <strong>凸性</strong>——逻辑回归的负对数似然是<strong>凸函数</strong>(海森 Xᵀdiag(p(1−p))X 半正定),故任何局部最优即全局最优,可用牛顿法/IRLS 快速收敛(通常 5–10 次迭代);② <strong>完全分离问题</strong>——若数据线性可分,系数会趋向无穷(似然单调上升但永不达到最大值),表现为迭代不收敛、系数爆炸、标准误巨大;解法是加 L2 正则(等价于高斯先验的 MAP)或使用 Firth 惩罚似然。③ <strong>系数解释</strong>——e^{βⱼ} 是优势比(odds ratio),表示特征每增 1 单位优势的倍数,这是业务方偏好逻辑回归的主要原因;但要注意这依赖'其他特征不变'的假设,共线时解释不可靠。
⚠️ Common Interview Pitfalls
- ✕用 MSE 训练逻辑回归(梯度在饱和区消失)
- ✕对线性可分数据不做正则(系数发散)
🎯 Interviewer Follow-ups
- ?为什么不用 MSE 训练逻辑回归?
- ?逻辑回归的梯度形式是什么?(p-y)x
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.