返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: distributed-tracing-observability

全链路分布式追踪与可观测性

Distributed Tracing & Observability
🎯核心定义
全链路分布式追踪与可观测性体系 (Distributed Tracing & LLM Observability Architecture,如 OpenTelemetry, LangSmith, Arize Phoenix, OpenLLMetry) 是现代复杂大模型与 Agent 系统监控调试、性能剖析与质量审计的“黑匣子记录仪”;系统在每个外部请求进入网关时生成全局唯一的 `Trace ID` 与层级 `Span ID`,跨服务无缝透传并实时捕获全生命周期埋点数据:1) 核心性能延迟指标:首字生成延迟 (Time To First Token, TTFT)、每输出 Token 生成耗时 (Time Per Output Token, TPOT)、总耗时与网络 RTT;2) 成本与 Token 消耗审计:Prompt Tokens、Completion Tokens、Cached Tokens 与各模型调用计费账单;3) 运行时状态捕获:包含 Prompt 模板完整渲染文本、RAG 检索 Chunk 列表与相似度分值、Agent 工具调用入参与返回值、以及安全护栏拦截日志。
💡使用场景
生产级大模型应用故障排查、复杂多步 Agent 循环死锁诊断、LLM API 账单成本归因、以及 RAG 幻觉召回质检。
解决的核心痛点
传统分布式追踪只记录 RPC 耗时,无法透视大模型内部漫长的生成过程与 Agent 内部混乱的多步工具循环;LLM 专属可观测性提供了从“网络层 -> 检索层 -> 提示词层 -> Token 输出流”的全透明全链路白盒级可观测体验。
🎯5 个高频面试考点 (Exam Points)
1
详细定义大模型服务两大黄金延迟指标:首字延迟 (TTFT: Time To First Token) 与每输出 Token 延迟 (TPOT: Time Per Output Token) 的计算公式与瓶颈分析?
2
基于 OpenTelemetry 规范设计自定义 LLM Semantic Conventions(如 `gen_ai.system`, `gen_ai.usage.prompt_tokens`, `gen_ai.request.model`)?
3
多步 Agent 循环中如何通过 Parent-Child Span 树状拓扑图记录 Thought \to Action \to Observation 的完整轨迹并检测死循环超时?
4
敏感数据脱敏与隐私保护 (PII Masking):在追踪日志写入持久化存储(如 ClickHouse / Jaeger)之前,如何通过正则表达式/NER 自动遮蔽身份证、密码与银行卡?
5
在线生成质量监控:如何将 RAGAS 评估指标(如忠实度 Faithfulness、答案相关度 Answer Relevance)作为异步 Span Evaluator 嵌入追踪流?
📖 关联深度指南:📄 llm-rag-agent-system-design
更新于 2026-08-14
🎯
检验攻克程度:针对「全链路分布式追踪与可观测性」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点上下文预算与动态 Token 分配下一个知识点异步任务队列与状态解耦架构

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回YouTube DNN 召回架构粗排轻量模型与向量相似度剪枝