返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: inference-engine

推理引擎 vLLM/SGLang/TensorRT-LLM

Inference Engines vLLM/SGLang/TensorRT-LLM
🎯核心定义
推理引擎 = 把 LLM 权重、KV 缓存调度、批处理、内核优化打包成高效推理服务的系统软件层,核心职责是最大化 GPU 利用率与吞吐、压低 TTFT/TBT。三主流对比: ① vLLM —— 首创 PagedAttention(分页 KV 缓存,消除碎片)与 Continuous Batching(迭代级调度),API 兼容 OpenAI/HF、生态最大、开箱即用,显存利用率与吞吐提升明显(对比 naive 连续缓存,同等显存可服务更多并发),支持张量并行/PD 分离;② SGLang —— 核心是 RadixAttention(基数树前缀 KV 复用,长 prompt、多轮对话、多租户共享系统提示场景 TTFT 显著下降)与更高频的调度优化,更擅长 Prefill 密集型与 Agent 多轮场景,提供结构化输出 (constrained decoding) 原生支持;③ TensorRT-LLM —— NVIDIA 官方,图优化 + 算子融合 + 精度自动选择(FP16/BF16/FP8/INT4),单卡/单机延迟与吞吐的极致选项,但图编译与 C++ 编程复杂度高、灵活性低、冷启动慢。共同底座: Continuous Batching(请求级动态批)、量化后端(AWQ/FP8/INT4/GPTQ)、张量并行、PD 分离(Prefill 算力密集节点与 Decode 带宽密集节点分开部署)、推测解码。量化后端选型: FP8(E4M3,H100 原生支持,精度损失最小,服务侧主流,吞吐比 FP16 约翻倍)、AWQ(激活感知的权重量化,按激活分布敏感度保护重要通道,INT4 下精度接近 FP16)、INT4/INT8(显存减半/减 4 倍,可支撑更长上下文)。评估指标: TTFT(首 token 延迟,受 prefill 与调度影响)、TBT/TPOT(每 token 间隔,decode 吞吐)、总吞吐 tokens/s、P95 延迟。
💡使用场景
生产环境 LLM 服务选型(vLLM 通用首选 / SGLang 长上下文与多轮 / TensorRT-LLM 极致性能);面试高频“三个引擎的核心机制对比”“Continuous Batching 为什么标配”“量化后端怎么选”。
解决的核心痛点
朴素批处理引擎因静态批与连续 KV 分配导致 GPU 空闲与显存浪费;引擎层用分页 KV + 迭代级调度 + 前缀复用把 GPU 利用率从约 50-70% 提升到 90%+,配合量化与 PD 分离让同样硬件吞吐提升数倍、成本下降 —— 引擎对比的实质是“调度策略 × 显存管理 × 内核优化”三种杠杆的组合。
🎯5 个高频面试考点 (Exam Points)
1
vLLM vs SGLang vs TensorRT-LLM 核心机制对比: PagedAttention / RadixAttention / 图优化+量化;各自最适合什么负载(TTFT 敏感?吞吐极限?灵活性?)。
2
为什么 Continuous Batching 是引擎标配: 对比静态批,迭代级调度下快请求不被慢请求阻塞,吞吐可提升 2-3×;解释完成/插入/抢占的每步逻辑。
3
量化后端选型: FP8(E4M3, H100 原生,吞吐约 2×FP16)vs AWQ(激活感知,INT4 精度接近 FP16)vs INT4/INT8(显存减半/1/4)的精度/速度/显存取舍。
4
PD 分离为什么提升吞吐与稳定性: prefill 算力密集、decode 带宽密集,混跑互相干扰;分离后各自节点最优批大小,解释 TTFT 与 TBT 如何分别受益。
5
用指标评估引擎: TTFT / TBT / 吞吐 tokens/s / P95 的定义与测量;给定单卡峰值吞吐与平均输出长度,估算可支撑的并发与 QPS。
📖 关联深度指南:📄 high-concurrency-ai-system
更新于 2026-08-12
🎯
检验攻克程度:针对「推理引擎 vLLM/SGLang/TensorRT-LLM」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点推测解码下一个知识点连续批处理

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)弹性伸缩与成本优化检查点与故障恢复