M5-029M5: NLP & Large Language ModelsInstruction Tuning & Supervised Fine-TuningMedium
Mastery:

Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 数据来源的选择与各自取舍(人工 / 强模型蒸馏 / 开源 / 合成+验证)。

📐 Mathematical Definition
quality×scale×cost−1 tradeoff across sources\text{quality}\times\text{scale}\times\text{cost}^{-1}\ \text{tradeoff across sources}
⚡ Executive Summary
Core Concept: 人工质量最高但贵且慢;强模型蒸馏可扩展但有同质化与合规风险;开源便利但质量参差;合成+验证对可验证任务最优。

📌 Key Takeaways

  • •
    人工:质量最高、可控,但贵慢、规模受限
  • •
    强模型蒸馏:便宜可扩展,但同质化 + 许可/合规风险
  • •
    开源数据集:便利,但质量与格式参差、需清洗
  • •
    合成+验证:可验证任务质量可控(数学/代码)

📐 Mathematical Derivations

数学机理:<strong>四类来源的三角权衡(质量 × 规模 × 成本)</strong>。<strong>(1) 人工标注</strong>——由专家撰写(指令,回答)对。<strong>优点</strong>:质量最高、可精确控制(覆盖特定能力、风格、安全要求)、可保证正确性。<strong>缺点</strong>:贵(每条约数美元到数十美元)、慢(无法快速扩展)、标注者能力参差。<strong>适用</strong>:核心能力的高质量种子数据、安全关键数据、评测集。<strong>(2) 强模型蒸馏</strong>——用更强的模型(如闭源旗舰)生成指令数据。<strong>优点</strong>:便宜、快、可大规模扩展、质量通常不错。<strong>缺点</strong>:(a) <strong>同质化</strong>(风格趋同、多样性下降);(b) <strong>继承教师的偏见与错误</strong>;(c) <strong>许可与合规风险</strong>(多数 API 的服务条款禁止'用输出训练竞争模型');(d) <strong>能力上限受教师限制</strong>(学生难以超越教师)。<strong>适用</strong>:快速构建大规模指令数据(需注意合规)。<strong>(3) 开源数据集</strong>——使用公开的指令数据集(如 FLAN、OpenAssistant、UltraChat 等)。<strong>优点</strong>:免费、便利、有一定质量。<strong>缺点</strong>:质量与格式<strong>参差</strong>(需大量清洗与去重)、可能含错误与有害内容、<strong>可能污染评测集</strong>。<strong>适用</strong>:冷启动、补充多样性。<strong>(4) 合成 + 验证</strong>——对<strong>可验证任务</strong>(数学、代码、形式化)用程序生成题目 + 自动验证答案。<strong>优点</strong>:质量<strong>可控</strong>(只有正确答案进入训练)、可无限扩展、覆盖难度可调。<strong>缺点</strong>:只适用可验证任务;生成的问题可能模式化(多样性不足)。<strong>适用</strong>:数学/代码等推理任务(这是当前推理模型数据的主力)。<strong>组合策略</strong>——实践中<strong>混合使用</strong>:(a) 少量人工数据保证质量与安全;(b) 强模型蒸馏扩大规模(注意合规);(c) 开源数据补充多样性;(d) 合成+验证强化推理能力;(e) 全部经过<strong>统一格式转换 + 去重 + 质量过滤 + 污染检查</strong>。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'混合是必然'</strong>——单一来源都有明显缺陷;工业界的 SFT 数据几乎都是多来源混合(如'人工 5% + 蒸馏 40% + 开源 30% + 合成 25%')。关键是<strong>统一格式、去重、质量过滤</strong>。② <strong>合规风险是现实约束</strong>——用闭源 API 的输出训练模型通常违反服务条款;这促使'用开源强模型蒸馏'或'合成+验证'成为更安全的选择。面试中能提到这点会显得专业。③ <strong>'数据多样性'比'数据量'重要</strong>——强模型蒸馏的数据虽然多,但风格单一;故需用 (a) 多教师、(b) 多种 prompt 模板、(c) 温度调节、(d) 混入开源数据 来提升多样性。④ <strong>污染检查不可省略</strong>——开源与合成数据都可能含评测集内容;必须做 n-gram 重叠检测(见污染题)。⑤ <strong>与'数据配比'的衔接</strong>——来源选择解决'从哪来',配比解决'各占多少'(见配比题);两者共同决定 SFT 效果。⑥ <strong>面试要点</strong>——被问'SFT 数据从哪来',应给出'<strong>四类来源 × 质量/规模/成本三角权衡</strong>'与'<strong>混合 + 统一格式 + 去重 + 污染检查</strong>'的工程流程,并主动提到'强模型蒸馏的合规风险';这是'有实战经验'的标志。
⚠️ Common Interview Pitfalls
  • ✕
    只用开源数据不做清洗与去重
  • ✕
    忽略强模型蒸馏的服务条款合规风险
🎯 Interviewer Follow-ups
  • ?
    为什么强模型蒸馏有合规风险?
  • ?
    如何组合多种来源?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-028: Instruction Tuning & Supervised Fine-Tuning: 解释拒绝采样微调(RFT / STaR)的机制与作用。📋Back to BankNext →M5-030: Alignment & RLHF: 描述 RLHF 的三阶段流程。