🎯核心定义
推理引擎 = 把 LLM 权重、KV 缓存调度、批处理、内核优化打包成高效推理服务的系统软件层,核心职责是最大化 GPU 利用率与吞吐、压低 TTFT/TBT。三主流对比: ① vLLM —— 首创 PagedAttention(分页 KV 缓存,消除碎片)与 Continuous Batching(迭代级调度),API 兼容 OpenAI/HF、生态最大、开箱即用,显存利用率与吞吐提升明显(对比 naive 连续缓存,同等显存可服务更多并发),支持张量并行/PD 分离;② SGLang —— 核心是 RadixAttention(基数树前缀 KV 复用,长 prompt、多轮对话、多租户共享系统提示场景 TTFT 显著下降)与更高频的调度优化,更擅长 Prefill 密集型与 Agent 多轮场景,提供结构化输出 (constrained decoding) 原生支持;③ TensorRT-LLM —— NVIDIA 官方,图优化 + 算子融合 + 精度自动选择(FP16/BF16/FP8/INT4),单卡/单机延迟与吞吐的极致选项,但图编译与 C++ 编程复杂度高、灵活性低、冷启动慢。共同底座: Continuous Batching(请求级动态批)、量化后端(AWQ/FP8/INT4/GPTQ)、张量并行、PD 分离(Prefill 算力密集节点与 Decode 带宽密集节点分开部署)、推测解码。量化后端选型: FP8(E4M3,H100 原生支持,精度损失最小,服务侧主流,吞吐比 FP16 约翻倍)、AWQ(激活感知的权重量化,按激活分布敏感度保护重要通道,INT4 下精度接近 FP16)、INT4/INT8(显存减半/减 4 倍,可支撑更长上下文)。评估指标: TTFT(首 token 延迟,受 prefill 与调度影响)、TBT/TPOT(每 token 间隔,decode 吞吐)、总吞吐 tokens/s、P95 延迟。