🎯核心定义
用大数据集 (如 ImageNet) 预训练的权重初始化目标任务。冻结策略依据特征分层性: 浅层学习通用低级特征 (边缘/纹理/颜色), 深层编码任务相关语义, 因此常用做法是冻结前层、只训练最后若干层; 特征提取 (feature extraction) 完全冻结骨干、只训练新分类头 (骨干学习率为 0), 微调 (fine-tuning) 则全部或部分参数以小学习率继续训练。灾难性遗忘: 新任务更新会覆盖旧任务知识, 缓解手段包括更小学习率、冻结部分层、EWC 等参数正则。
💡使用场景
目标数据量小的 CV/NLP 任务的标准起步方案 (ImageNet 预训练 CNN、LLM 的指令微调/领域微调); 面试必问何时冻结、何时微调。
⚡解决的核心痛点
目标任务数据不足时随机初始化会过拟合, 从头训练需要百万级样本; 迁移复用大数据上学到的通用表征, 几千张图即可得到可用模型, 样本需求降数个数量级。选择规则: 数据少且与预训练分布相似 → 特征提取; 数据多或分布差异大 → 微调; 代价是分布不匹配与灾难性遗忘需要控制。