M8-031M8: ML Systems, Engineering & ResearchInference Serving & DeploymentEasy
Mastery:
Inference Serving & Deployment: 解释模型服务的常见部署形态。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 在线(低延迟同步)、批处理(高吞吐异步)、流式(持续输入)、边缘(本地);以及'级联/多模型'的组合。
📌 Key Takeaways
- •在线:同步请求-响应(低延迟、高可用)
- •批处理:离线大批量(高吞吐、可等待)
- •流式:持续输入(事件驱动);边缘:本地推理(低延迟/隐私)
📐 Mathematical Derivations
数学机理:<strong>四种部署形态</strong>——(1) <strong>在线(online / real-time)</strong>——(a) <strong>模式</strong>——同步请求-响应(用户等待结果);(b) <strong>要求</strong>——低延迟(毫秒到秒)、高可用(99.9%+)、自动扩缩容;(c) <strong>场景</strong>——推荐/搜索/风控/对话;(d) <strong>实现</strong>——模型服务(Triton/TorchServe/vLLM)+ 负载均衡 + 自动扩缩容。(2) <strong>批处理(batch / offline)</strong>——(a) <strong>模式</strong>——离线处理大批数据(无需等待);(b) <strong>特点</strong>——高吞吐(可用全部资源)、可等待(小时级)、成本低(按需启动);(c) <strong>场景</strong>——离线推荐(预计算)、批量评分、数据标注;(d) <strong>实现</strong>——Spark/分布式推理(GPU 批处理)。(3) <strong>流式(streaming)</strong>——(a) <strong>模式</strong>——持续消费事件流,逐条/微批推理;(b) <strong>场景</strong>——实时风控(交易流)、实时监控、IoT;(c) <strong>实现</strong>——Flink/Kafka + 模型服务(低延迟)。(4) <strong>边缘(edge / on-device)</strong>——(a) <strong>模式</strong>——模型部署在<strong>本地设备</strong>(手机/IoT/车机);(b) <strong>优点</strong>——(i) 极低延迟(无网络);(ii) 隐私(数据不出设备);(iii) 离线可用;(c) <strong>约束</strong>——(i) <strong>算力/内存/功耗</strong>受限(需小模型 + 量化 + 剪枝);(ii) 更新难(需 OTA);(iii) 碎片化(设备异构);(d) <strong>场景</strong>——键盘输入预测、语音唤醒、图像处理。(5) <strong>混合/级联</strong>——(a) <strong>多级</strong>——'边缘粗筛 + 云端精算';(b) <strong>模型级联</strong>(小模型快速筛选 + 大模型精算);(c) <strong>批 + 在线</strong>——'离线预计算候选 + 在线精排'(推荐系统的常见架构)。<strong>选择依据</strong>——(a) <strong>延迟需求</strong>(毫秒→边缘/在线;小时→批处理);(b) <strong>吞吐需求</strong>(高吞吐→批处理);(c) <strong>隐私</strong>(敏感数据→边缘);(d) <strong>成本</strong>(批处理最便宜);(e) <strong>更新频率</strong>(高频更新→云端);(f) <strong>设备约束</strong>(端侧→小模型)。<strong>与其他问题的关系</strong>——(a) 与'推理引擎'(在线服务的实现);(b) 与'自动扩缩容'(在线服务的弹性);(c) 与'成本优化'(批处理最省)。<strong>实践建议</strong>——(a) <strong>按延迟与吞吐需求选形态</strong>;(b) <strong>推荐系统用'离线预计算 + 在线精排'</strong>(成本与延迟的平衡);(c) <strong>边缘用'小模型 + 量化'</strong>;(d) <strong>批处理优先</strong>(若可等待——成本最低);(e) <strong>级联</strong>(成本-质量平衡)。<strong>度量</strong>——(a) 延迟/吞吐;(b) 成本;(c) 可用性;(d) 资源利用率。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'推荐系统用离线预计算 + 在线精排'</strong>——这是工业界的经典架构;面试中能指出是深度理解的标志。② <strong>'批处理成本最低'</strong>——若业务可等待,优先批处理。③ <strong>'边缘的约束'</strong>——算力/内存/功耗 + 更新难 + 碎片化。④ <strong>'级联(小模型+大模型)'</strong>——成本-质量的平衡。⑤ <strong>'隐私驱动边缘'</strong>——敏感数据不出设备。⑥ <strong>面试要点</strong>——被问'模型怎么部署',应给出'<strong>四形态(在线/批处理/流式/边缘)+ 选择依据(延迟/吞吐/隐私/成本)+ 混合与级联</strong>';能指出'离线预计算+在线精排'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕为可等待的场景用在线服务(成本高)
- ✕边缘部署不考虑算力约束
🎯 Interviewer Follow-ups
- ?什么场景用批处理?
- ?边缘部署的约束?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.