LLM 服务监控分三层: ① 系统级指标——延迟(P50/P95/P99)、吞吐(QPS、tokens/sec)、错误率(4xx/5xx 与超时)、GPU 利用率、KV cache 命中率与排队长度;② Token 级指标——TTFT(Time To First Token,请求发出到首个 token 返回的时间)与 TPOT(Time Per Output Token,单个 token 的生成耗时),总延迟
T=TTFT+TPOT×(N−1),其中
TPOT=N−1Tdecode(解码总耗时除以生成的 token 数);③ 日志与 trace——记录请求/响应、参数、工具调用链路的分布式追踪,把一次多跳对话串成一条完整 trace,支撑按请求维度定位;④ 告警与根因分析——围绕 SLO 预算设置分级告警,异常时沿 trace 区分输入侧(超长 prompt)、服务侧(排队、显存 OOM、pod 扩容)还是模型侧(输出退化)。