返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: capacity-estimation-latency-budget

容量估算与延迟预算推演

Capacity Estimation & Latency Budgeting
🎯核心定义
容量估算与延迟预算推演 (Capacity Estimation & Latency Budgeting Calculation) 是系统设计面试与大型工业系统立项前,基于第一性原理对系统规模、存储空间、网络吞吐、算力成本与端到端延迟预算进行严密量化推导的工程数学推演方法;核心包含 5 大推算公式族:1) QPS 估算:Average QPS=DAU×RequestsPerUser86400s\text{Average QPS} = \frac{\text{DAU} \times \text{RequestsPerUser}}{86400\text{s}},峰值 Peak QPS=25×Average QPS\text{Peak QPS} = 2 \sim 5 \times \text{Average QPS};2) 存储容量:Daily Storage=DAU×EventsPerUser×BytesPerEvent\text{Daily Storage} = \text{DAU} \times \text{EventsPerUser} \times \text{BytesPerEvent},推导 5 年总存储(含 3 副本冗余系数 3x);3) 网络带宽:Bandwidth=Peak QPS×PayloadSize×8 bits\text{Bandwidth} = \text{Peak QPS} \times \text{PayloadSize} \times 8\text{ bits};4) 算力 GPU 卡数:GPUs=Peak QPS×LatencyPerRequestConcurrencyPerGPU\text{GPUs} = \lceil \frac{\text{Peak QPS} \times \text{LatencyPerRequest}}{\text{ConcurrencyPerGPU}} \rceil;5) 延迟预算分解:将端到端 50ms 严格分解为网络 RTT (10ms) + 存储 I/O (10ms) + 模型推理 (25ms) + 序列化 (5ms)。
💡使用场景
系统设计面试第 2 步定量分析、云上架构采购预算申报、微服务 SLA 耗时分解与容量规划。
解决的核心痛点
缺乏量化推导会导致系统设计沦为空谈甚至设计出无法落地的荒谬架构(如给 1000 万 QPS 的场景使用关系型数据库单机写);容量推演确保了系统组件选型(Redis vs Cassandra vs S3)具有坚不可摧的数据支撑。
🎯5 个高频面试考点 (Exam Points)
1
熟练推导“1 亿 DAU、每人每天浏览 100 次、每次请求生成 10 个视频推荐”场景下的平均 QPS、峰值 QPS 与网络带宽需求?
2
对于包含 1 亿个物品、每个物品 1024 维 FP32 向量(单向量 4KB)的场景,推导 HNSW 内存索引总占用空间(含图拓扑结构开销 1.5×\sim 1.5\times)?
3
大模型 Token 吞吐与 GPU 算力推演:在峰值 1000 并发流式请求下,生成速率 50 tokens/s 时需要多少张 H100 显卡?
4
经典硬件延迟数字常识记忆(L1 缓存 0.5ns、L2 缓存 7ns、RAM 内存访问 100ns、SSD 读取 100µs、同机房网络 RTT 0.5ms、跨洋网络 150ms)在面试中的应用?
5
存储系统的 3 副本机制 (3-way Replication) 与冷热数据分层(7 天热数据存 NVMe SSD,历史数据转存 S3 冷存储)的成本精算?
更新于 2026-08-14
🎯
检验攻克程度:针对「容量估算与延迟预算推演」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点系统设计 5 步面试答题方法论

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回YouTube DNN 召回架构粗排轻量模型与向量相似度剪枝