TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
知识蒸馏
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
distillation
知识蒸馏
Knowledge Distillation
🎯
核心定义
知识蒸馏 (KD) 让学生模型模仿教师模型的软输出分布
p
T
=
softmax
(
z
/
T
)
p_T = \text{softmax}(z/T)
p
T
=
softmax
(
z
/
T
)
(温度
T
T
T
软化概率,放大类间暗知识),损失为
L
=
α
L
C
E
(
y
,
p
S
)
+
(
1
−
α
)
⋅
T
2
⋅
KL
(
p
S
∥
p
T
)
\mathcal{L} = \alpha \mathcal{L}_{CE}(y, p_S) + (1-\alpha) \cdot T^2 \cdot \text{KL}(p_S \| p_T)
L
=
α
L
C
E
(
y
,
p
S
)
+
(
1
−
α
)
⋅
T
2
⋅
KL
(
p
S
∥
p
T
)
;
T
2
T^2
T
2
用于补偿软化后的梯度尺度。
💡
使用场景
把大模型压缩成可部署的小模型、无标注数据上的知识迁移 (教师输出当软标签)、跨架构学习 (LLM 教师蒸馏到小 Transformer);在 LLM 压缩中与量化正交——量化减少位宽、蒸馏减少模型容量,两者可叠加使用。
⚡
解决的核心痛点
模型过大无法直接部署时,蒸馏把教师的泛化知识浓缩进学生,训练成本低于从零训练同规模模型,且软标签保留了类间相似性信息,比硬标签学得更多;与量化是两条互补的压缩轴,叠加后压缩比更高。
🎯
5 个高频面试考点 (Exam Points)
1
蒸馏为什么学软标签而不是硬标签?
2
温度 T 的作用?T 过大/过小有什么影响?
3
蒸馏与量化是什么关系?为什么说两者正交?
4
蒸馏的常见变体有哪些 (logits/特征/自蒸馏)?
5
学生与教师容量差距过大时会出现什么问题?如何缓解?
📖 关联深度指南:
📄 quantization-and-compression →
更新于 2026-08-12
🎯
检验攻克程度:针对「知识蒸馏」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
激活异常值处理与 FP8
下一个知识点 →
MoE 路由 Top-k
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA