M5-022M5: NLP & Large Language ModelsInstruction Tuning & Supervised Fine-TuningMedium
Mastery:
Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 中的灾难性遗忘与缓解。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: SFT 在小数据上微调会损害预训练的通用能力;用低 lr、少 epoch、混合通用数据、LoRA/正则缓解。
📌 Key Takeaways
- •表现:通用能力下降、语言多样性下降、重复输出
- •成因:小数据 + 高 lr + 多 epoch 使模型过拟合 SFT 分布
- •缓解:低 lr、1~3 epoch、混合通用数据、LoRA、KL 正则
📐 Mathematical Derivations
数学机理:<strong>灾难性遗忘(catastrophic forgetting)</strong> 指模型在学习新任务时<strong>丢失原有的能力</strong>。在 SFT 中表现为:(a) <strong>通用能力下降</strong>(在未微调的任务上变差);(b) <strong>语言多样性下降</strong>(输出风格趋同、模板化);(c) <strong>重复与退化</strong>(倾向于复述 SFT 数据中的句式);(d) <strong>知识遗忘</strong>(原有事实知识受影响)。<strong>成因</strong>——(a) <strong>数据规模小</strong>(SFT 数据常是预训练的 1e-4~1e-6 量级),故模型容易<strong>过拟合</strong>到 SFT 分布;(b) <strong>学习率高</strong>(相对预训练);(c) <strong>多 epoch</strong>(SFT 通常只训 1~3 epoch,超过则严重过拟合);(d) <strong>分布偏移大</strong>(SFT 的指令格式与预训练的'续写'分布差异大)。<strong>缓解手段</strong>:(a) <strong>低学习率</strong>(常用 1e-5~2e-5,远低于预训练);(b) <strong>少 epoch</strong>(1~3,并监控验证 loss);(c) <strong>混合通用数据</strong>(在 SFT 数据中混入一定比例的预训练数据或通用指令数据,锚定原分布);(d) <strong>LoRA/PEFT</strong>(冻结基座、只训少量参数,天然缓解遗忘);(e) <strong>KL 正则</strong>(对基座模型的输出加 KL 惩罚,约束偏离);(f) <strong>模型合并</strong>(把 SFT 模型与基座合并,或与通用模型合并);(g) <strong>经验回放</strong>(rehearsal:混入原任务的样本)。<strong>检测方法</strong>——(a) 在<strong>通用基准</strong>(如 MMLU、常识推理)上测 SFT 前后的表现;(b) 测<strong>输出多样性</strong>(不同 prompt 的响应熵、n-gram 多样性);(c) 测<strong>困惑度</strong>(在通用文本上的 PPL 是否上升);(d) 人工评估'风格是否僵化'。<strong>权衡</strong>——'对齐'(学会指令)与'保持能力'(不遗忘)存在张力:SFT 越激进,对齐越强但遗忘越重;故需平衡(这也是'对齐税'的一种表现)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'数据规模比'是关键</strong>——SFT 数据量与预训练数据量相差 4~6 个数量级,故'过拟合'风险天然很高。这解释了为何'SFT 用 1~3 epoch、低 lr'是标准配置。② <strong>'混合通用数据'的实践</strong>——工业界常在 SFT 数据中混入 5%~30% 的<strong>预训练数据或通用指令数据</strong>;这能显著缓解遗忘(因为它把'预训练分布'重新注入)。这是最简单有效的缓解手段。③ <strong>LoRA 的天然优势</strong>——因为基座冻结,LoRA 微调的遗忘风险远低于全参微调;这使 LoRA 成为'快速适配而不伤原能力'的首选(尤其在领域适配)。④ <strong>'语言多样性下降'的产品影响</strong>——SFT 过度会导致所有输出风格趋同(如都以'当然!'开头),损害用户体验与创造力;故需在数据中保留<strong>风格多样性</strong>。⑤ <strong>与 RLHF 的关系</strong>——RLHF 也有遗忘风险(尤其 KL 惩罚过小);故 RLHF 中的 <strong>KL 惩罚</strong>既是'防奖励黑客'也是'防遗忘'。⑥ <strong>面试要点</strong>——被问'SFT 会遗忘吗',应给出'<strong>成因(数据小 + 高 lr + 多 epoch + 分布偏移)+ 缓解(低 lr/少 epoch/混合通用数据/LoRA/KL 正则/模型合并)+ 检测(通用基准/多样性/PPL)</strong>'的完整框架;能指出'混合通用数据'是最简单有效的手段是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕SFT 训很多 epoch(严重过拟合)
- ✕不做通用能力的回归测试(无法发现遗忘)
🎯 Interviewer Follow-ups
- ?为什么 SFT 会导致'语言多样性下降'?
- ?如何检测灾难性遗忘?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.