M5-013M5: NLP & Large Language ModelsPretraining Objectives & Data CurationMedium
Mastery:
Pretraining Objectives & Data Curation: 解释预训练数据的领域配比与退火阶段(annealing)的作用。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 领域配比决定能力分布;退火阶段在训练末尾用高质量/领域数据并降 lr,低成本地强化目标能力。
📌 Key Takeaways
- •配比:各领域权重决定能力分布(代码/数学/多语言)
- •退火:末尾用小比例步数 + 高质量数据 + 降 lr
- •收益:低成本提升特定能力(数学/代码/长上下文)
📐 Mathematical Derivations
数学机理:<strong>领域配比(domain mixture)</strong>——预训练语料由多个域组成(网页、书籍、论文、代码、数学、多语言),各域的采样权重 w_d 决定模型的能力分布。<strong>配比的影响是非直觉的</strong>:(a) 提高代码权重不仅提升代码能力,还<strong>提升通用推理</strong>(代码含结构化逻辑与长程依赖);(b) 提高数学权重提升数学与符号推理;(c) 网页权重过高会使模型'通用但浅';(d) 多语言权重影响跨语言能力。<strong>配比需实验搜索</strong>——常用<strong>小规模消融</strong>(在小模型上试多组配比、选最优再放大),或用 <strong>DoReMi</strong>(用参考模型与代理模型的<strong>最坏情况超额损失</strong>自动搜索域权重,保证在各域上都不劣于参考分布)。<strong>退火阶段(annealing / decay phase)</strong>——在训练<strong>末尾的一小段步数</strong>(如总步数的 5%~20%)做两件事:(1) <strong>数据切换</strong>——用<strong>高质量/目标领域</strong>数据(数学、代码、指令、长文本);(2) <strong>学习率衰减</strong>——lr 快速降到接近 0。<strong>为什么有效</strong>——(a) <strong>低成本</strong>(只占总步数的小部分,但影响最终权重);(b) <strong>'精炼'效应</strong>——低 lr 阶段模型从'探索状态'收敛到极小值,此时用高质量数据可让最终解'偏向'该能力(类似'最后阶段的数据决定模型落在哪个盆地');(c) <strong>与 WSD 调度的配合</strong>(WSD 的 decay 段天然适合放退火数据)。<strong>实证</strong>——多个工作(如 LLaMA 系、以及'data annealing'专门研究)报告:在退火阶段加入目标领域数据可显著提升该领域指标(如数学 +5~10 分),而对其他领域影响很小。<strong>退火数据量</strong>——通常为<strong>几亿到几十亿 token</strong>(相对总预训练量很小),但需<strong>高质量且与目标能力对齐</strong>。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'退火'是性价比最高的能力调优手段</strong>——它只改最后 5%~20% 的数据与 lr,成本极低但收益明确;相比'从头调整配比重训'(成本 100%),退火是'用最小代价定向强化能力'。故实践中优先做退火。② <strong>退火与 SFT 的边界</strong>——退火仍在<strong>预训练框架</strong>内(用 CLM 目标、在大量数据上),而 SFT 是<strong>单独阶段</strong>(用指令格式、少量数据);两者可叠加(先退火强化基础能力,再 SFT 教格式)。③ <strong>'数据决定盆地'的直觉</strong>——训练末尾的低 lr 阶段,模型从探索状态收敛;此时数据分布决定了'收敛到哪个极小值'。这与'高 lr 探索、低 lr 精炼'的 WSD 理论一致。④ <strong>配比搜索的成本</strong>——完整搜索配比需多次预训练(昂贵);故用'小模型代理 + 最优搜索'(DoReMi)或'在退火阶段做配比实验'(便宜)来近似。⑤ <strong>长上下文的退火</strong>——长上下文能力常通过'末尾用长文本数据退火 + 位置编码缩放调整'获得;这是'低成本获得长上下文'的常用手段(相比全程用长序列训练)。⑥ <strong>面试要点</strong>——被问'如何提升模型的数学能力',应给出'<strong>提高数学配比(需消融搜索)+ 末尾退火(高质量数学数据 + 降 lr)</strong>',并说明'退火是性价比最高的手段';能解释'为什么末尾数据决定最终解'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕忽略退火阶段(错失低成本能力调优机会)
- ✕退火阶段用低质量数据(反而损害)
🎯 Interviewer Follow-ups
- ?为什么退火数据要用更低的 lr?
- ?退火阶段应该放多少数据?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.