M8-045M8: ML Systems, Engineering & ResearchCost & Latency OptimizationEasy
Mastery:
Cost & Latency Optimization: 解释模型路由(model routing)的思路与收益。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 按查询难度或成本预算把请求分配到不同规模/不同价格的模型,用便宜模型处理大多数简单请求、只在必要时升级到强模型,在质量约束下最小化平均成本。
📌 Key Takeaways
- •路由信号——查询长度/复杂度、检索置信度、历史准确率、分类器或小模型的置信度
- •路由策略——阈值规则、成本感知分类器、级联(cascade)、学习式路由(bandit)
- •级联与投机——先小模型试答,置信度低再升级(可视为生成侧的路由)
- •收益——平均成本显著下降,质量接近全用大模型;代价是路由本身的误差与复杂度
- •风险——误判难度导致强请求被降级(质量损失)或弱请求被升级(浪费成本)
📐 Mathematical Derivations
数学机理:<strong>路由的形式化</strong>——(1) <strong>目标</strong>——在平均质量约束下最小化期望成本:min E[cost] s.t. E[quality] ≥ q_0;等价地,在成本预算下最大化质量。(2) <strong>路由信号(router features)</strong>——(a) <strong>查询侧</strong>——长度、语言、领域、复杂度估计;(b) <strong>检索侧</strong>——检索分数/置信度(RAG 中检索差则需强模型);(c) <strong>模型侧</strong>——小模型的自置信度(logprob/熵)、多个小模型的一致性;(d) <strong>历史侧</strong>——相似查询的历史表现。(3) <strong>路由策略</strong>——(a) <strong>阈值规则</strong>——按启发式阈值(简单、可解释、难调优);(b) <strong>成本感知分类器</strong>——训练一个分类器预测'哪个模型能答对',并最小化期望成本(可把成本作为损失权重);(c) <strong>级联(cascade)</strong>——串行:小模型先答,若置信度 < τ 则升级到大模型;<strong>总成本 = c_small + p_escalate·c_large</strong>;(d) <strong>学习式路由</strong>——用 contextual bandit 在线学习(探索-利用)。(4) <strong>质量-成本权衡</strong>——(a) <strong>质量约束</strong>——设最低质量 q_0(如大模型准确率的 95%);(b) <strong>成本函数</strong>——不同模型的单位成本(自建 GPU 成本或 API 价格);(c) <strong>最优解</strong>——在满足质量约束的解空间中取成本最低者。(5) <strong>理论收益</strong>——若大多数请求是简单的(分布长尾),则'便宜模型处理多数 + 强模型处理少数'的平均成本远低于全用强模型。<strong>风险与难点</strong>——(a) <strong>路由误判</strong>——把难请求判为简单 → 质量损失;把简单判为难 → 成本浪费;(b) <strong>置信度校准</strong>——小模型的置信度需校准才能可靠地做升级判断;(c) <strong>分布漂移</strong>——路由分类器也需监控与再训练;(d) <strong>评测</strong>——需端到端评测'路由后的平均质量与成本',而非只评路由分类器准确率。<strong>与其他问题的关系</strong>——(a) 与推测解码(生成侧路由);(b) 与语义缓存(前置的省成本层);(c) 与成本-质量-延迟三方权衡。<strong>度量</strong>——(a) 平均单位成本;(b) 平均质量(对比全用强模型的相对值);(c) 升级率;(d) 路由延迟开销。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>路由的价值来自请求难度的长尾分布</strong>——若所有请求都难,路由无收益。② <strong>级联是最简单可靠的路由</strong>——无需训练分类器,用置信度阈值即可;面试中能给出级联公式是深度理解的标志。③ <strong>置信度校准是前提</strong>——未校准的小模型置信度会让级联失效。④ <strong>路由本身有延迟开销</strong>——若路由很贵,会抵消收益。⑤ <strong>端到端评测是关键</strong>——只看路由准确率会掩盖质量损失。⑥ <strong>与缓存互补</strong>——缓存挡掉重复请求,路由处理新请求。⑦ <strong>面试要点</strong>——被问怎么降低大模型服务成本,应给出'<strong>缓存 → 路由/级联 → 蒸馏 → 量化</strong>'的分层方案,并强调'先定位请求难度分布,再决定是否值得做路由';能指出级联公式与置信度校准是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为路由一定能降本(忽略请求难度分布)
- ✕不校准置信度就做级联(升级判断失准)
🎯 Interviewer Follow-ups
- ?路由分类器本身出错怎么办?
- ?路由与级联(cascade)有何区别?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.