返回 深度学习 思维导图
中文·English
🧠 深度学习ID: transfer-learning

迁移学习与微调

Transfer Learning
🎯核心定义
用大数据集 (如 ImageNet) 预训练的权重初始化目标任务。冻结策略依据特征分层性: 浅层学习通用低级特征 (边缘/纹理/颜色), 深层编码任务相关语义, 因此常用做法是冻结前层、只训练最后若干层; 特征提取 (feature extraction) 完全冻结骨干、只训练新分类头 (骨干学习率为 0), 微调 (fine-tuning) 则全部或部分参数以小学习率继续训练。灾难性遗忘: 新任务更新会覆盖旧任务知识, 缓解手段包括更小学习率、冻结部分层、EWC 等参数正则。
💡使用场景
目标数据量小的 CV/NLP 任务的标准起步方案 (ImageNet 预训练 CNN、LLM 的指令微调/领域微调); 面试必问何时冻结、何时微调。
解决的核心痛点
目标任务数据不足时随机初始化会过拟合, 从头训练需要百万级样本; 迁移复用大数据上学到的通用表征, 几千张图即可得到可用模型, 样本需求降数个数量级。选择规则: 数据少且与预训练分布相似 → 特征提取; 数据多或分布差异大 → 微调; 代价是分布不匹配与灾难性遗忘需要控制。
🎯5 个高频面试考点 (Exam Points)
1
什么情况下用特征提取、什么情况下用微调? 判断依据?
2
为什么浅层特征通用、深层特征任务相关?
3
灾难性遗忘的成因与缓解方法?
4
微调的学习率为什么通常远小于从头训练?
5
预训练数据与目标分布差异大时怎么办?
📖 关联深度指南:📄 debugging-and-dl-comp
更新于 2026-08-12
🎯
检验攻克程度:针对「迁移学习与微调」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点数据增强

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化