返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: semantic-cache-gateway

语义缓存与请求去重

Semantic Cache & Request Deduplication
🎯核心定义
语义缓存与请求去重网关 (Semantic Cache & Request Deduplication Gateway,如 GPTCache, Redis Semantic Caching) 是部署在大模型推理与 RAG 检索入口前的智能高速缓存层;与传统必须字面完全一致的精确哈希缓存 (Exact KV Cache) 不同,语义缓存利用 Embedding 模型将用户 Query 编码为稠密向量,在毫秒级内(<3ms<3\text{ms})在内存向量索引中进行余弦相似度检索:若与历史缓存 Query 的相似度超过设定阈值 τ\tau(如 cos(q1,q2)0.95\cos(q_1, q_2) \ge 0.95),则判定为“语义完全等价”,直接将缓存中的检索结果与 LLM 生成文本秒级返回给用户;同时网关结合基于 Redis Distributed Lock 的单飞机制 (Singleflight / Mutex),防止相同热门 Query 瞬间高并发打垮后端检索与大模型集群。
💡使用场景
智能客服高频常见问题秒级问答、企业知识库热点搜索、以及大模型 API 成本与首字延迟优化。
解决的核心痛点
大模型调用成本高昂(按 Token 计费)且推理延迟长(动辄数秒);语义缓存拦截了 30%~50% 的高频相似问题,将这部分请求的响应延迟从 2000ms 压缩至 5ms,并直接节省 40%+ 的 Token 调用账单。
🎯5 个高频面试考点 (Exam Points)
1
详细对比精确匹配缓存 (Exact String Match) 与语义向量缓存 (Semantic Vector Match) 在命中率、延迟与假阳性 (False Positive) 风险上的权衡?
2
语义相似度阈值 τ\tau(如 τ=0.92\tau=0.92 vs τ=0.98\tau=0.98)的严谨标定方法:如何避免不同含义但句式相似的问题被错误命中(如“如何开户”与“如何销户”)?
3
在高并发突发流量下,如何基于 Singleflight (单飞模式) 或 Redis 互斥锁防止缓存击穿 (Cache Stampede / Thundering Herd)?
4
语义缓存的主动失效与更新策略 (Cache Eviction / Invalidation):当底层知识库文档更新时,如何通过反向元数据索引级联清除失效缓存项?
5
多租户语义缓存的安全隔离:如何保证租户 A 的私有问答结果绝对不会被租户 B 的相似 Query 命中并泄露?
📖 关联深度指南:📄 llm-rag-agent-system-design
更新于 2026-08-14
🎯
检验攻克程度:针对「语义缓存与请求去重」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点在线多路并行检索网关下一个知识点企业级多租户隔离与 RBAC 权限

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回YouTube DNN 召回架构粗排轻量模型与向量相似度剪枝