M2-006M2: Classical Machine LearningLogistic Regression & GLMEasy
Mastery:

Logistic Regression & GLM: 写出逻辑回归的模型形式与损失函数。

📐 Mathematical Definition
p=σ(w⊤x),L=−∑[ylog⁡p+(1−y)log⁡(1−p)]p=\sigma(w^\top x),\qquad \mathcal L=-\sum\big[y\log p+(1-y)\log(1-p)\big]
⚡ Executive Summary
Core Concept: sigmoid 输出概率,用交叉熵(对数似然)训练;是 GLM 中 Bernoulli + logit 链接。

📌 Key Takeaways

  • •
    线性决策边界(特征空间)
  • •
    没有闭式解,用梯度/牛顿/IRLS

📐 Mathematical Derivations

模型与损失:逻辑回归假设 log(p/(1−p))=wᵀx(logit 是线性的),反解得 p=σ(wᵀx)=1/(1+e^{−wᵀx})。损失来自<strong>极大似然</strong>:对 N 个样本,负对数似然为 −Σ[yᵢlog pᵢ+(1−yᵢ)log(1−pᵢ)],即二元交叉熵。关键性质是<strong>梯度极其简洁</strong>:∇_w L=Σᵢ(pᵢ−yᵢ)xᵢ=Xᵀ(p−y)——这与线性回归的梯度 Xᵀ(Xw−y) 形式一致,只是把 Xw 换成 σ(Xw)。这个简洁性来自 sigmoid 导数 σ'=σ(1−σ) 与交叉熵的巧妙配合(链式法则中的分母被约掉),这也是为什么<strong>不用 MSE + sigmoid</strong>:后者的梯度含 σ' 因子,在饱和区趋近 0,导致梯度消失。

🏭 Production Trade-offs

两个实践要点:① <strong>凸性</strong>——逻辑回归的负对数似然是<strong>凸函数</strong>(海森 Xᵀdiag(p(1−p))X 半正定),故任何局部最优即全局最优,可用牛顿法/IRLS 快速收敛(通常 5–10 次迭代);② <strong>完全分离问题</strong>——若数据线性可分,系数会趋向无穷(似然单调上升但永不达到最大值),表现为迭代不收敛、系数爆炸、标准误巨大;解法是加 L2 正则(等价于高斯先验的 MAP)或使用 Firth 惩罚似然。③ <strong>系数解释</strong>——e^{βⱼ} 是优势比(odds ratio),表示特征每增 1 单位优势的倍数,这是业务方偏好逻辑回归的主要原因;但要注意这依赖'其他特征不变'的假设,共线时解释不可靠。
⚠️ Common Interview Pitfalls
  • ✕
    用 MSE 训练逻辑回归(梯度在饱和区消失)
  • ✕
    对线性可分数据不做正则(系数发散)
🎯 Interviewer Follow-ups
  • ?
    为什么不用 MSE 训练逻辑回归?
  • ?
    逻辑回归的梯度形式是什么?(p-y)x
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-005: Linear Regression: 推导线性回归的最小二乘解,并说明其几何意义。📋Back to BankNext →M2-007: Logistic Regression & GLM: 解释 odds 与 log-odds,以及系数如何解释。