M5-011M5: NLP & Large Language ModelsPretraining Objectives & Data CurationHard
Mastery:
Pretraining Objectives & Data Curation: 解释合成数据在预训练/后训练中的作用与风险。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用强模型/规则生成数据(教科书式、指令、CoT);可补齐稀缺能力,但有分布偏移、同质化与'模型坍缩'风险。
📌 Key Takeaways
- •用途:教科书式数据、指令数据、CoT 轨迹、代码/数学题
- •优势:可控制质量与分布、补齐稀缺能力(如长 CoT)
- •风险:同质化、错误传播、模型坍缩、评测污染
📐 Mathematical Derivations
数学机理:<strong>合成数据(synthetic data)</strong> 指用模型(或规则/程序)生成、而非从真实世界采集的训练数据。<strong>主要用途</strong>:(a) <strong>教科书式数据</strong>(Phi 系列用 LLM 生成'教科书质量'的解释与练习);(b) <strong>指令数据</strong>(self-instruct、Evol-Instruct:用强模型生成多样化指令与回答);(c) <strong>CoT 轨迹</strong>(用强模型生成推理步骤,蒸馏到小模型);(d) <strong>代码/数学题</strong>(可程序化生成 + 自动验证,质量可控);(e) <strong>偏好数据</strong>(用 AI 反馈替代人类反馈,RLAIF)。<strong>优势</strong>:(a) <strong>可控</strong>——可指定风格、难度、领域,补齐真实数据稀缺的能力(如高质量长 CoT);(b) <strong>可扩展</strong>——不受真实数据量限制;(c) <strong>可验证</strong>——对代码/数学可自动检查正确性(这是 RLVR 的基础)。<strong>风险</strong>:(a) <strong>分布偏移</strong>——合成数据分布与真实分布不同,过度依赖会导致'在合成分布上强、真实分布上弱';(b) <strong>同质化(homogenization)</strong>——同一教师模型生成的数据风格单一,学生学到的多样性下降(表现为输出风格趋同、创造力下降);(c) <strong>错误传播</strong>——教师的错误被学生继承并放大;(d) <strong>模型坍缩(model collapse)</strong>——若多代模型都用'上一代生成的合成数据'训练,分布会<strong>逐代收窄</strong>(丢失长尾、方差下降),最终退化(Shumailov 等 2024);(e) <strong>评测污染</strong>——合成数据可能包含与评测集相似的内容,导致虚高。<strong>缓解</strong>:(a) <strong>混合真实与合成数据</strong>(保持真实分布锚点);(b) <strong>严格过滤与验证</strong>(规则校验、模型打分、去重);(c) <strong>多样性控制</strong>(多教师、多模板、温度调节);(d) <strong>限制代数</strong>(避免多代累积);(e) <strong>人工审核关键数据</strong>。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'可验证'是合成数据的最大优势</strong>——对代码(跑测试)、数学(对答案)、形式化证明(验证器)等任务,合成数据可<strong>自动验证正确性</strong>,故质量可控;这也是 RLVR(可验证奖励强化学习)的基础。对'主观'任务(写作、对话),验证困难,风险更高。② <strong>模型坍缩的机制</strong>——每代模型只'看到'上一代输出的分布,故<strong>尾部概率被系统性丢失</strong>(因为低概率样本很少被采样到);多代后分布收窄、多样性崩塌。故<strong>必须混入真实数据</strong>作为锚点。③ <strong>同质化与'风格税'</strong>——用单一强模型生成的指令数据会让所有下游模型的输出风格趋同(如都带'Certainly!'开头);这对产品差异化与创造力有负面影响。④ <strong>与'数据受限'的关系</strong>——真实高质量数据耗尽('数据墙')是合成数据流行的根本原因;但合成数据<strong>不能完全替代</strong>真实数据(它承载的是'已有知识的重组',而非'新知识')。⑤ <strong>质量控制的具体手段</strong>——(a) <strong>拒绝采样</strong>(生成多个、只保留通过验证的);(b) <strong>模型打分</strong>(用更强的模型或奖励模型筛选);(c) <strong>难度控制</strong>(避免过易/过难);(d) <strong>去重与多样性度量</strong>。⑥ <strong>面试要点</strong>——被问'合成数据怎么看',应给出'<strong>用途(教科书/指令/CoT/可验证任务)+ 优势(可控可扩展可验证)+ 风险(分布偏移/同质化/错误传播/模型坍缩/污染)+ 缓解(混合真实数据/严格过滤/多教师/限代数)</strong>'的完整框架;能解释'模型坍缩'的机制是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为合成数据可以完全替代真实数据
- ✕多代合成数据不混入真实数据(模型坍缩)
🎯 Interviewer Follow-ups
- ?什么是'模型坍缩'?
- ?如何控制合成数据的质量?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.