M8-048M8: ML Systems, Engineering & ResearchCost & Latency OptimizationHard
Mastery:

Cost & Latency Optimization: 解释成本-质量-延迟的三方权衡与决策框架。

📐 Mathematical Definition
min⁡m∈M cost(m)s.t.  latency(m)≤ℓ0,  quality(m)≥q0\min_{m\in\mathcal M}\ \text{cost}(m)\quad \text{s.t.}\ \ \text{latency}(m)\le \ell_0,\ \ \text{quality}(m)\ge q_0
⚡ Executive Summary
Core Concept: 三者不可同时最优;正确做法是把延迟与质量设为 SLO 硬约束,再在可行解空间中最小化成本,并按场景分层配置而非全局取折中。

📌 Key Takeaways

  • •
    先定约束后优化——延迟/质量是硬 SLO,成本是目标函数(而非三者平权折中)
  • •
    分层配置——不同请求等级(免费/付费/关键路径)用不同模型与预算
  • •
    帕累托前沿——量化、蒸馏、缓存、路由把前沿外推(同时改善三者)
  • •
    决策依据——业务价值(质量提升的收益)vs 成本增量的边际分析
  • •
    降级预案——预算超支或延迟超标时按预设顺序降级(强模型→小模型→缓存→规则)

📐 Mathematical Derivations

数学机理:<strong>三方权衡的形式化</strong>——(1) <strong>约束优化视角</strong>——(a) <strong>目标</strong>——最小化成本;(b) <strong>约束</strong>——延迟 ≤ ℓ_0、质量 ≥ q_0;<strong>延迟与质量是硬约束而非可交换的项</strong>;(c) <strong>理由</strong>——延迟超 SLO 会流失用户、质量低于下限会损害信任,二者不是'可以拿成本换'的连续量。(2) <strong>帕累托前沿(Pareto frontier)</strong>——(a) <strong>定义</strong>——在给定技术下,三者能达到的最优边界;(b) <strong>技术手段外推前沿</strong>——(i) <strong>量化</strong>——同时降成本与延迟(精度略降);(ii) <strong>蒸馏</strong>——降成本与延迟(质量略降);(iii) <strong>缓存/路由</strong>——降成本与延迟(质量基本不变);(iv) <strong>更好的 kernel</strong>——降延迟(无质量损失);(c) <strong>决策</strong>——若新技术使前沿外推,则可能同时改善三者('免费午餐'),应优先采用。(3) <strong>边际分析</strong>——(a) <strong>质量提升的价值</strong>——用业务指标(转化/留存/满意度)量化;(b) <strong>成本增量</strong>——单位请求成本上升幅度;(c) <strong>决策</strong>——若价值增量 > 成本增量则值得;(d) <strong>注意</strong>——质量与业务价值常呈递减(0.9→0.95 的收益可能远大于 0.95→0.98)。(4) <strong>分层配置</strong>——(a) <strong>按请求等级</strong>——关键路径(付费/高价值)用强模型与低延迟;非关键用便宜模型;(b) <strong>按时间</strong>——高峰期限流降级、低谷期放开;(c) <strong>按用户</strong>——免费用户降级、付费用户保障;(d) <strong>好处</strong>——比'全局取折中'更优(不同请求的 SLO 不同)。(5) <strong>降级预案</strong>——(a) <strong>顺序</strong>——强模型 → 小模型 → 缓存 → 规则/静态;(b) <strong>触发</strong>——延迟超标、成本超预算、故障;(c) <strong>可观测</strong>——降级必须可监控、可告警、可恢复。(6) <strong>常见误区</strong>——(a) <strong>等权折中</strong>——把三者加权求和,忽略了延迟/质量是硬约束;(b) <strong>只看平均</strong>——忽略尾延迟(P99);(c) <strong>只看成本</strong>——忽略质量下降的长期用户流失。<strong>与其他问题的关系</strong>——(a) 与模型路由、缓存、量化、蒸馏;(b) 与 SLO 与可靠性;(c) 与在线实验(验证质量-成本权衡的实际效果)。<strong>度量</strong>——(a) 单位请求成本;(b) 延迟分位数(P50/P95/P99);(c) 质量指标(离线 + 在线);(d) 业务指标与单位经济性。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>延迟与质量是硬约束而非可交换项</strong>——面试中能指出'不应等权折中'是深度理解的标志。② <strong>帕累托前沿可被技术外推</strong>——量化/蒸馏/缓存/路由能同时改善三者,应优先采用。③ <strong>分层配置优于全局折中</strong>——不同请求的 SLO 不同。④ <strong>边际分析是关键决策工具</strong>——质量收益递减,需按业务价值判断。⑤ <strong>降级预案必须预设且可观测</strong>——否则高峰期会雪崩。⑥ <strong>尾延迟常被忽略</strong>——平均值达标不代表 P99 达标。⑦ <strong>面试要点</strong>——被问怎么权衡成本-质量-延迟,应给出'<strong>先定延迟/质量 SLO 硬约束 → 在可行域内最小化成本 → 用帕累托外推技术(量化/蒸馏/缓存/路由)→ 分层配置 → 预设降级</strong>';能指出'不应等权折中'与'尾延迟'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    把成本、质量、延迟等权加权求和
  • ✕
    只看平均延迟不看 P99
🎯 Interviewer Follow-ups
  • ?
    如何判断一次质量提升是否值得其成本?
  • ?
    为什么不应把三者做等权折中?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM8-047: Cost & Latency Optimization: 解释批处理(含连续批处理)对吞吐与延迟的双向影响。📋Back to BankNext →M8-049: Cost & Latency Optimization: 解释推测解码(speculative decoding)的延迟-成本权衡。