返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: dataset-management

数据集管理与血缘

Dataset Management & Lineage
🎯核心定义
数据集管理是对训练数据的版本、血缘、存储、合规与生命周期进行系统化治理, 核心工具是 DVC (Data Version Control): 数据文件本体不入 Git, 版本库只存元数据(文件哈希、依赖关系), 数据以内容寻址存储 (Content-Addressed Storage, 哈希即地址) 保存, 从而获得与代码一致的版本、分支与回滚能力。血缘 (Lineage) 记录「原始数据 → 清洗特征 → 训练集 → 模型」的完整上下游链路。合规与质量: 训练数据去重(精确哈希或 MinHash/LSH 近似去重)、PII 脱敏、许可/版权审查、数据出境合规; 精确去重的哈希碰撞概率按生日悖论估算 Pn22m+1P \approx \frac{n^2}{2^{m+1}}, 其中 mm 为哈希位数、nn 为样本数。
💡使用场景
大模型训练集达 TB~PB 级、文件数量百万级, Git 直接管理不现实; 复现实验要求「代码 + 数据 + 模型」版本对齐; 监管与审计需要训练数据来源可追溯; 面试常问 DVC 与 Git 的分工、数据去重怎么做、训练数据版权与合规边界。
解决的核心痛点
相比整份数据复制备份: 内容寻址 + 去重让存储占用大幅下降(相同文件只存一份, 版本间只存差异), 回滚秒级完成; 血缘让任何模型产出都能追溯到数据与代码版本, 可复现、可审计; 去重与合规检查避免重复/侵权样本进入训练集, 降低模型记忆偏差与法律风险。
🎯5 个高频面试考点 (Exam Points)
1
DVC 如何实现大数据集版本管理? 为什么数据文件不入 Git, 元数据与数据如何分离?
2
数据血缘 (Lineage) 的价值是什么? 如何记录与追溯「数据 → 特征 → 模型」链路?
3
训练数据去重的两类方法(精确哈希 vs MinHash/LSH 近似)各适合什么场景? 哈希碰撞概率公式是什么?
4
训练数据合规包含哪些要点? PII 脱敏、版权许可、数据出境如何落地?
5
数据生命周期管理: 保留、归档与删除策略如何设计? 数据版本与模型版本如何关联?
📖 关联深度指南:📄 mlops-and-testing
更新于 2026-08-12
🎯
检验攻克程度:针对「数据集管理与血缘」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
下一个知识点模型权重与检查点存储

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)弹性伸缩与成本优化检查点与故障恢复