M8-039M8: ML Systems, Engineering & ResearchMonitoring & Drift DetectionMedium
Mastery:

Monitoring & Drift Detection: 解释监控体系的分层设计。

📐 Mathematical Definition
layers: infra→service→model→business;correlate across layers\text{layers}:\ \text{infra}\to\text{service}\to\text{model}\to\text{business};\qquad \text{correlate across layers}
⚡ Executive Summary
Core Concept: 四层:基础设施(GPU/CPU/网络)→ 服务(延迟/错误/吞吐)→ 模型(输入分布/预测分布/性能)→ 业务(CTR/GMV)。

📌 Key Takeaways

  • •
    基础设施:GPU/CPU/内存/网络/磁盘
  • •
    服务:延迟/错误率/吞吐/QPS
  • •
    模型:输入分布、预测分布、性能(离线+在线);业务:CTR/GMV/留存

📐 Mathematical Derivations

数学机理:<strong>监控体系的四层</strong>——(1) <strong>基础设施层(infra)</strong>——(a) <strong>GPU</strong>(利用率、显存、温度、ECC 错误);(b) <strong>CPU/内存</strong>;(c) <strong>网络</strong>(带宽、丢包、延迟);(d) <strong>磁盘/存储</strong>(IOPS、容量);(e) <strong>容器/编排</strong>(Pod 状态、重启次数);<strong>作用</strong>——发现'硬件/资源'问题。(2) <strong>服务层(service)</strong>——(a) <strong>延迟</strong>(P50/P99——见推理服务指标);(b) <strong>错误率</strong>(5xx/超时/异常);(c) <strong>吞吐</strong>(QPS);(d) <strong>可用性</strong>(SLA 达标率);(e) <strong>队列长度/排队时间</strong>;(f) <strong>依赖健康</strong>(数据库/缓存/下游服务);<strong>作用</strong>——发现'服务可用性'问题。(3) <strong>模型层(model)</strong>——(a) <strong>输入分布</strong>(特征分布漂移——PSI/KL);(b) <strong>预测分布</strong>(预测的分布变化——如'预测分数的均值/分布');(c) <strong>性能指标</strong>(离线:定期评估;在线:AUC/准确率——若有标签);(d) <strong>置信度/不确定性</strong>(预测熵);(e) <strong>特征质量</strong>(空值率/越界率);<strong>作用</strong>——发现'模型失效'(漂移/退化)。(4) <strong>业务层(business)</strong>——(a) <strong>核心指标</strong>(CTR/GMV/留存);(b) <strong>护栏指标</strong>(负反馈/多样性);(c) <strong>分群指标</strong>(新/老用户、地区、场景);<strong>作用</strong>——发现'业务影响'(最终目标)。<strong>为什么需要分层</strong>——(a) <strong>定位问题</strong>——业务指标下降 → 逐层排查(模型?服务?基础设施?);(b) <strong>预警</strong>——底层问题会逐层传导(GPU 故障 → 服务延迟 → 业务下降);底层监控更早发现;(c) <strong>责任划分</strong>——不同团队负责不同层;(d) <strong>SLO 定义</strong>——各层有各自的 SLO。<strong>跨层关联(correlation)</strong>——(a) <strong>时间对齐</strong>(同一时间窗的指标);(b) <strong>因果链</strong>(GPU 温度↑ → 降频 → 延迟↑ → 超时↑ → 业务↓);(c) <strong>统一看板</strong>(把各层放在一起);(d) <strong>告警关联</strong>(一个根因触发多个告警 → 归并)。<strong>其他要素</strong>——(a) <strong>日志</strong>(结构化日志 + 检索);(b) <strong>链路追踪(tracing)</strong>(分布式追踪——定位跨服务延迟);(c) <strong>指标(metrics)</strong>(时序数据库);(d) <strong>告警</strong>(阈值/异常检测——见告警设计题);(e) <strong>可视化</strong>(看板);(f) <strong>SLO/SLI/Error Budget</strong>(可靠性工程)。<strong>与其他问题的关系</strong>——(a) 与'漂移检测'(模型层);(b) 与'告警设计'(下一题);(c) 与'可靠性与降级'(服务层)。<strong>实践建议</strong>——(a) <strong>四层全覆盖</strong>(不要只看业务);(b) <strong>跨层关联</strong>(统一看板 + 因果链);(c) <strong>底层预警</strong>(更早发现);(d) <strong>分层 SLO</strong>;(e) <strong>结构化日志 + tracing</strong>;(f) <strong>告警降噪</strong>(见告警设计题)。<strong>度量</strong>——(a) 各层的覆盖率;(b) MTTD(发现时间)/MTTR(恢复时间);(c) 告警的准确率;(d) 事故的根因定位时间。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'四层全覆盖'</strong>——只看业务指标无法定位问题;面试中能指出是深度理解的标志。② <strong>'底层预警更早'</strong>——GPU 故障先于业务下降;故底层监控价值大。③ <strong>'跨层关联'定位根因</strong>——时间对齐 + 因果链。④ <strong>'SLO/SLI/Error Budget'</strong>——可靠性工程的基础。⑤ <strong>'告警关联'降噪</strong>——一个根因触发多个告警时归并。⑥ <strong>面试要点</strong>——被问'怎么设计监控体系',应给出'<strong>四层(基础设施/服务/模型/业务)+ 为什么分层(定位/预警/责任)+ 跨层关联 + SLO/日志/tracing</strong>';能指出'底层预警更早'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    只监控业务指标(无法定位根因)
  • ✕
    不做跨层关联(告警噪声大)
🎯 Interviewer Follow-ups
  • ?
    为什么需要分层?
  • ?
    如何'跨层关联'定位问题?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-038: Monitoring & Drift Detection: 列举漂移检测的常用方法。📋Back to BankNext →M8-040: Monitoring & Drift Detection: 解释标签延迟对模型监控的影响。