语义缓存与请求去重网关 (Semantic Cache & Request Deduplication Gateway,如 GPTCache, Redis Semantic Caching) 是部署在大模型推理与 RAG 检索入口前的智能高速缓存层;与传统必须字面完全一致的精确哈希缓存 (Exact KV Cache) 不同,语义缓存利用 Embedding 模型将用户 Query 编码为稠密向量,在毫秒级内(
<3ms)在内存向量索引中进行余弦相似度检索:若与历史缓存 Query 的相似度超过设定阈值
τ(如
cos(q1,q2)≥0.95),则判定为“语义完全等价”,直接将缓存中的检索结果与 LLM 生成文本秒级返回给用户;同时网关结合基于 Redis Distributed Lock 的单飞机制 (Singleflight / Mutex),防止相同热门 Query 瞬间高并发打垮后端检索与大模型集群。