M5-023M5: NLP & Large Language ModelsInstruction Tuning & Supervised Fine-TuningMedium
Mastery:

Instruction Tuning & Supervised Fine-Tuning: 解释 CoT 蒸馏的作用与风险。

📐 Mathematical Definition
CoT distill: y=(step1,…,stepk,answer);risk: format-only imitation\text{CoT distill}:\ y=(\text{step}_1,\dots,\text{step}_k,\text{answer});\qquad \text{risk}:\ \text{format-only imitation}
⚡ Executive Summary
Core Concept: 用强模型的推理轨迹(含中间步骤)做 SFT,可显著提升小模型的推理;风险是'模仿格式而非能力'与错误继承。

📌 Key Takeaways

  • •
    做法:用强模型生成含推理步骤的回答做 SFT
  • •
    收益:小模型推理能力显著提升(远优于只用答案)
  • •
    风险:学到格式而非能力、继承教师错误、长度膨胀

📐 Mathematical Derivations

数学机理:<strong>CoT 蒸馏</strong>——用强模型(教师)生成<strong>含中间推理步骤</strong>的回答('先分析…再计算…最后答案'),把这些轨迹作为 SFT 数据训练小模型(学生)。<strong>为什么有效</strong>:(a) <strong>提供了推理的'过程监督'</strong>——只学'问题→答案'时,模型需自己发现推理路径(很难);学'问题→步骤→答案'时,模型直接模仿<strong>推理的格式与步骤分解</strong>,大大降低了学习难度;(b) <strong>激活了预训练中的推理能力</strong>——预训练已包含大量推理文本,CoT 数据提供了'如何组织推理'的示范;(c) <strong>实证</strong>——多个工作(如 Orca、以及各类'蒸馏推理模型')显示:用含 CoT 的教师输出做 SFT,小模型的推理能力显著优于只用答案的 SFT,甚至可接近教师(在特定基准上)。<strong>风险</strong>:(a) <strong>学到'格式'而非'能力'</strong>——学生可能学会'输出推理步骤的格式'(看起来在思考),但推理的<strong>正确性</strong>并未真正提升('假装推理');在分布外的问题上会暴露;(b) <strong>继承教师错误</strong>——教师的错误推理被学生学去并放大;(c) <strong>长度膨胀</strong>——学生学会'写很长的推理'(因为教师输出长),导致推理成本上升且可能'过度思考';(d) <strong>同质化</strong>——单一教师的推理风格被复制,学生缺乏多样性;(e) <strong>对不可验证任务的失效</strong>——数学/代码可验证(能筛掉错误轨迹),但写作/开放推理难以验证,风险更高。<strong>缓解</strong>:(a) <strong>只保留正确轨迹</strong>(对可验证任务用答案校验过滤);(b) <strong>多教师混合</strong>(增加多样性);(c) <strong>长度控制</strong>(过滤过长/冗余的推理);(d) <strong>配合 RL</strong>(先用 CoT 蒸馏冷启动,再用 RLVR 优化真实正确率——这是当前推理模型的标准配方);(e) <strong>过程奖励</strong>(用 PRM 评估推理步骤质量)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'CoT 蒸馏 + RLVR'是当前推理模型的标准配方</strong>——CoT 蒸馏提供'会推理的格式'(冷启动),RLVR 用可验证奖励优化'推理的正确性';两者互补(前者教格式、后者教正确)。仅有 CoT 蒸馏会出现'格式对但答案错'。② <strong>'格式 vs 能力'的区分方法</strong>——在<strong>分布外</strong>任务上测学生的推理正确率;若格式漂亮但正确率不升,说明只学到格式。这是评估 CoT 蒸馏效果的关键。③ <strong>教师质量的天花板</strong>——学生的上限受教师(以及筛选标准)限制;若教师在某些任务上弱,学生也弱。故'多教师 + 按任务选择教师'可提升上限。④ <strong>长度膨胀的代价</strong>——推理长度直接决定推理成本(token 数);故'用更短的推理达到同等正确率'是有价值的目标(有'长度惩罚'、'简洁 CoT'等方向)。⑤ <strong>与'拒绝采样微调(RFT)'的关系</strong>——RFT(rejection sampling fine-tuning)用模型自己生成多个答案、只保留正确的做 SFT;这是'自蒸馏'(无需强教师),且天然过滤错误(对可验证任务)。它与 CoT 蒸馏是同一思想的不同变体。⑥ <strong>面试要点</strong>——被问'如何提升小模型的推理',应给出'<strong>CoT 蒸馏(教格式)+ 只保留正确轨迹 + 多教师 + 再用 RLVR 优化正确性</strong>'的配方,并指出'<strong>可能只学到格式而非能力</strong>'这一核心风险;能说明'CoT 蒸馏与 RFT 是同一思想'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    只用教师的最终答案做 SFT(丢失推理过程)
  • ✕
    不过滤教师的错误轨迹
🎯 Interviewer Follow-ups
  • ?
    为什么 CoT 蒸馏比'只学答案'有效?
  • ?
    CoT 蒸馏与 RLVR 的关系?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-022: Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 中的灾难性遗忘与缓解。📋Back to BankNext →M5-024: Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 数据配比与多任务平衡。