TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
MLE 工程师 思维导图
›
手写逻辑回归梯度下降与 L2
← 返回 MLE 工程师 思维导图
中文
·
English
💻 MLE 工程师
ID:
mle-coding-logistic-regression-sgd
手写逻辑回归梯度下降与 L2
Live Coding: Logistic Regression SGD
🎯
核心定义
手写带 L2 正则化的逻辑回归与随机梯度下降训练器 (Live Coding: Logistic Regression with L2 Regularization & Mini-Batch SGD in Pure Numpy) 是考察 MLE 工程师对基础凸优化、Sigmoid 激活函数、交叉熵损失梯度推导与矩阵乘法工程实现的终极基石题;模型形式:
P
(
y
=
1
∣
x
)
=
σ
(
X
w
+
b
)
=
1
1
+
e
−
(
X
w
+
b
)
P(y=1|x) = \sigma(X w + b) = \frac{1}{1 + e^{-(X w + b)}}
P
(
y
=
1∣
x
)
=
σ
(
X
w
+
b
)
=
1
+
e
−
(
X
w
+
b
)
1
;带 L2 正则化的对数似然目标损失函数为:
L
(
w
)
=
−
1
N
∑
i
=
1
N
[
y
i
ln
(
y
^
i
)
+
(
1
−
y
i
)
ln
(
1
−
y
^
i
)
]
+
λ
2
N
∥
w
∥
2
\mathcal{L}(w) = -\frac{1}{N} \sum_{i=1}^N [y_i \ln(\hat{y}_i) + (1-y_i) \ln(1-\hat{y}_i)] + \frac{\lambda}{2N} \|w\|^2
L
(
w
)
=
−
N
1
∑
i
=
1
N
[
y
i
ln
(
y
^
i
)
+
(
1
−
y
i
)
ln
(
1
−
y
^
i
)]
+
2
N
λ
∥
w
∥
2
;其解析梯度为:
∇
w
L
=
1
N
X
T
(
y
^
−
y
)
+
λ
N
w
\nabla_w \mathcal{L} = \frac{1}{N} X^T (\hat{y} - y) + \frac{\lambda}{N} w
∇
w
L
=
N
1
X
T
(
y
^
−
y
)
+
N
λ
w
;每轮 Mini-Batch 依照梯度更新权重
w
←
w
−
η
∇
w
L
w \leftarrow w - \eta \nabla_w \mathcal{L}
w
←
w
−
η
∇
w
L
直至收敛。
💡
使用场景
经典二分类问题基线、广告 CTR 线性打分骨架、工业面试 15 分钟白板手写机器学习算法。
⚡
解决的核心痛点
考察候选人能否不用 `scikit-learn` 或 `PyTorch`,仅用 Pure Numpy 向量化矩阵操作完整闭环实现前向预测、损失计算、梯度反向传播与参数更新全流程。
🎯
5 个高频面试考点 (Exam Points)
1
现场手写包含 `fit(X, y)`、`predict_proba(X)` 与 L2 正则化的完整的 `LogisticRegression` Python Class?
2
从极大似然估计 (MLE) 完整推导逻辑回归对数损失函数及其权重梯度
∇
w
L
=
1
N
X
T
(
y
^
−
y
)
\nabla_w \mathcal{L} = \frac{1}{N} X^T (\hat{y} - y)
∇
w
L
=
N
1
X
T
(
y
^
−
y
)
的全过程?
3
Sigmoid 导数公式
σ
′
(
z
)
=
σ
(
z
)
(
1
−
σ
(
z
)
)
\sigma'(z) = \sigma(z)(1 - \sigma(z))
σ
′
(
z
)
=
σ
(
z
)
(
1
−
σ
(
z
))
的证明及其在反向传播链式法则中的应用?
4
牛顿法 (Newton-Raphson / IRLS: 迭代加权最小二乘法) 相比一阶梯度下降在收敛速度(二阶超线性收敛)与计算复杂度 (
O
(
d
3
)
O(d^3)
O
(
d
3
)
求逆) 上的权衡?
5
为什么逻辑回归必须配合特征标准化/归一化 (Feature Scaling)?如果不做标准化,椭圆损失等高线如何严重拖慢梯度下降收敛?
🔗
核心前置底层技术卡片 (点击穿透复习)
📊
[ML]
逻辑回归与对数几率
→
📐
[Math]
牛顿法与拟牛顿法
→
📖 关联深度指南:
📄 mle-coding-and-algo-prep →
更新于 2026-08-14
🎯
检验攻克程度:针对「手写逻辑回归梯度下降与 L2」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
手写目标检测 NMS 与 IoU 矩阵
下一个知识点 →
数据质量四大威胁与清洗管线
🔗 更多 MLE 工程师 知识点卡片
偏差-方差权衡与过拟合诊断
常见损失函数选型与梯度特性
优化器收敛性与动量选型准则
模型集成 Stacking 与 Blending