返回 大语言模型 思维导图
中文·English
大语言模型ID: pretrain-data-engineering

预训练数据工程

Pre-Training Data Engineering
🎯核心定义
预训练数据工程是决定模型能力上限的数据管线: 清洗 → 去重 → 质量过滤 → 域配比 → 退火注入。机制上, 去重用 MinHash+LSH: MinHash 把文档哈希为约 128 位签名, LSH 将签名分成多个 band 分桶, 桶内碰撞即为候选重复对;质量过滤用预训练语言模型的 PPL(困惑度)打分筛掉低质量文本; 域配比按 Web:Code:Math 等比例混合;退火期(最后约 5% 的 token)注入高质量数据与合成数据, 如 Evol-Instruct 逐轮进化生成高难度指令。
💡使用场景
大模型预训练前的数据管线、RLHF 偏好数据清洗、模型复现与数据影响分析。
解决的核心痛点
万亿级语料不去重会导致重复记忆、算力浪费与评测污染。MinHash+LSH 把相似对查找从 O(n2)O(n^2) 降到近似线性, 可扩展到万亿 token 规模;PPL 过滤能筛掉约 30%-50% 低质量文档; 退火期把高质量数据占比提到 50% 以上,同等 1.4T tokens 算力预算下可让下游基准提升数个点。
🎯5 个高频面试考点 (Exam Points)
1
MinHash 与 LSH 的原理? 为什么近似去重够用?
2
PPL 质量过滤怎么做? 低 PPL 一定代表高质量吗?
3
域配比(Web:Code:Math)如何设计? 影响哪些能力?
4
退火期是什么? 为什么要注入高质量/合成数据?
5
合成数据(Evol-Instruct 等)与数据污染的风险?
📖 关联深度指南:📄 llm-foundations-and-sota
更新于 2026-08-12
🎯
检验攻克程度:针对「预训练数据工程」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
下一个知识点训练目标与优化器细节

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA