返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: mlops-pipeline

MLOps 训练管线

MLOps Pipeline
🎯核心定义
MLOps 训练管线把“数据 → 训练 → 评估 → 部署”的模型生命周期工程化,核心四大件: ① CI/CD for ML——代码、数据、模型三种 artifact 都有自己的构建/测试/发布流水线,数据变更或代码合并自动触发训练冒烟测试;② 实验追踪——MLflow / W&B 记录每次实验的超参、指标、代码 commit、数据集版本与 artifact 链接,所有实验在同一坐标系可比;③ 可复现性——固定随机种子、锁定数据版本与环境依赖,并把输出指纹写入实验记录 h=H(dataconfigseed)h = H(\text{data} \parallel \text{config} \parallel \text{seed}),任何人可一键复现;④ 模型注册与灰度发布——注册表管理候选模型的 stage(开发/候选/生产)/版本/元数据,线上按流量比例 pp 从 1% 逐步放量到 100%,异常即回滚。
💡使用场景
训练从“一个人的 notebook”升级为多人协作的生产流程;面试常问 ML 的 CI/CD 与软件 CI/CD 有何不同、实验追踪怎么保证对比公平、可复现性差怎么排查、灰度发布与 A/B 测试的关系。
解决的核心痛点
没有管线时实验不可复现(换台机器跑不出同样结果)、候选模型无法横向对比、发布靠手工拷贝 checkpoint 极易出事故;CI/CD 让每次改动自动通过数据校验与训练冒烟,问题在合并前暴露;模型注册 + 灰度把回滚从“重训 + 重新部署”的小时级降到分钟级,线上事故影响面从 100% 流量收窄到 1% 的可观察窗口,可随时一键回退。
🎯5 个高频面试考点 (Exam Points)
1
MLOps 的 CI/CD 和传统软件 CI/CD 有什么不同?为什么数据和模型也要当 artifact 管?
2
实验追踪(MLflow/W&B)至少要记录哪些字段?怎样保证跨实验对比公平?
3
训练可复现性怎么保证?只固定随机种子够吗?(数据版本/环境/框架版本/硬件)
4
模型注册表与模型仓库有什么区别?灰度发布如何设计流量比例与回滚?
5
给定一次 notebook 训练产出,如何让同事在另一台机器上复现出相同结果?从哪几方面排查不可复现?
📖 关联深度指南:📄 mlops-and-testing
更新于 2026-08-12
🎯
检验攻克程度:针对「MLOps 训练管线」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点弹性伸缩与成本优化下一个知识点模型测试与评估门禁

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)检查点与故障恢复集群调度 Ray/K8s