M8-053M8: ML Systems, Engineering & ResearchMLOps & CI/CD for AIMedium
Mastery:

MLOps & CI/CD for AI: 解释持续训练(CT)的触发条件与治理要点。

📐 Mathematical Definition
retrain if  drift>δ ∨ metric<τ ∨ Δdata>D ∨ t≥t0\text{retrain if}\ \ \text{drift}>\delta\ \lor\ \text{metric}<\tau\ \lor\ \Delta\text{data}>D\ \lor\ t\ge t_0
⚡ Executive Summary
Core Concept: 触发可为定时、数据量累积、漂移超阈或线上指标下降;治理核心是自动评估+质量门+灰度+自动回滚,避免自动上线劣化模型。

📌 Key Takeaways

  • •
    触发信号——定时(周期性)、数据量(累积到阈值)、漂移(数据/概念)、性能(线上指标下降)
  • •
    训练自动化——数据准备、训练、评估、注册全自动,含可复现环境
  • •
    质量门——新模型必须通过门禁才允许候选上线
  • •
    发布治理——影子/金丝雀/A-B,按业务指标决定放量
  • •
    回滚与护栏——自动回滚(指标跌破护栏)、保留 champion、可人工冻结自动训练

📐 Mathematical Derivations

数学机理:<strong>持续训练(continuous training, CT)</strong>——(1) <strong>触发机制</strong>——(a) <strong>定时(periodic)</strong>——固定周期(日/周)再训练;<strong>优点</strong>——简单可预测;<strong>缺点</strong>——滞后(漂移发生在两次训练之间)、浪费(无变化时也训练);(b) <strong>数据量驱动</strong>——累积 Δdata 超过阈值(如新增 10% 数据);<strong>优点</strong>——数据效率高;<strong>缺点</strong>——数据快时过频、慢时滞后;(c) <strong>漂移驱动</strong>——数据漂移(PSI/KL > δ)或概念漂移(线上指标下降);<strong>优点</strong>——精准、及时;<strong>缺点</strong>——漂移检测有假阳性/假阴性、需可靠监控;(d) <strong>性能驱动</strong>——线上指标(含代理指标)低于 τ;<strong>优点</strong>——直接对齐目标;<strong>缺点</strong>——标签延迟导致反馈慢。(2) <strong>训练自动化</strong>——(a) <strong>数据准备</strong>——自动拉取最新数据、做时间点正确的特征回填;(b) <strong>训练</strong>——固定环境与种子、记录超参与血缘;(c) <strong>评估</strong>——离线指标 + 切片 + 鲁棒性;(d) <strong>注册</strong>——写入模型注册表(版本、指标、血缘)。(3) <strong>治理(governance)</strong>——(a) <strong>质量门</strong>——新模型必须通过门禁(整体+切片+工程约束)才成为候选;(b) <strong>发布</strong>——影子(对比但不影响用户)→ 金丝雀(小流量)→ 逐步放量 → 全量;(c) <strong>决策依据</strong>——在线业务指标(而非仅离线);(d) <strong>回滚</strong>——护栏(guardrail)指标跌破则自动回滚到 champion;(e) <strong>冻结</strong>——异常时可人工暂停自动训练(避免'自动上线劣化模型')。(4) <strong>风险</strong>——(a) <strong>反馈环</strong>——模型上线改变数据分布(如推荐改变用户行为),导致训练数据有偏;(b) <strong>数据泄漏</strong>——自动流水线可能误用未来数据;(c) <strong>静默劣化</strong>——漂移缓慢时指标变化不显著,难触发;(d) <strong>成本</strong>——频繁再训练成本高;(e) <strong>不稳定</strong>——频繁切换模型导致用户体验波动。(5) <strong>最佳实践</strong>——(a) <strong>多触发并用</strong>——定时兜底 + 漂移/性能触发加速;(b) <strong>门禁不可省</strong>;(c) <strong>灰度放量</strong>;(d) <strong>自动回滚护栏</strong>;(e) <strong>人工冻结开关</strong>;(f) <strong>记录每次训练与发布的决策</strong>(审计)。(6) <strong>与在线学习的关系</strong>——(a) <strong>持续训练</strong>——周期性批量再训练(慢);(b) <strong>在线学习</strong>——流式增量更新(快,但需处理稳定性与灾难性遗忘);(c) <strong>选择</strong>——延迟敏感且分布快变用在线学习;否则 CT 足够。<strong>与其他问题的关系</strong>——(a) 与 ML CI/CD(复用流水线);(b) 与漂移检测;(c) 与模型治理(审计);(d) 与在线学习。<strong>度量</strong>——(a) 再训练频率与成本;(b) 触发到上线的时延;(c) 自动回滚次数;(d) 线上指标随时间的稳定性。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>无门禁的自动上线是危险反模式</strong>——面试中能指出'自动训练 + 自动上线'的风险是深度理解的标志。② <strong>多种触发互补</strong>——定时兜底、漂移/性能加速。③ <strong>反馈环是 CT 的隐性陷阱</strong>——模型改变数据分布,训练数据有偏。④ <strong>灰度与自动回滚是安全网</strong>——先小流量、护栏跌破自动回滚。⑤ <strong>漂移检测的假阳性会造成频繁误训练</strong>——需阈值与稳定性约束。⑥ <strong>人工冻结开关必需</strong>——异常时可暂停自动化。⑦ <strong>面试要点</strong>——被问怎么设计持续训练,应给出'<strong>多触发(定时/数据/漂移/性能)+ 自动评估 + 质量门 + 影子/金丝雀 + 护栏自动回滚 + 人工冻结</strong>';能指出反馈环与无门禁上线的风险是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    自动训练后无门禁直接上线
  • ✕
    忽略反馈环导致训练数据有偏
🎯 Interviewer Follow-ups
  • ?
    为什么不能无门禁地自动上线再训练模型?
  • ?
    漂移触发与定时触发各有什么利弊?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-052: MLOps & CI/CD for AI: 解释模型上线的质量门(quality gate)设计。📋Back to BankNext →M8-054: MLOps & CI/CD for AI: 解释 ML 环境中环境与依赖的可复现性要求。