返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: context-memory-service

上下文缓存与记忆服务

Context & Memory Services
🎯核心定义
上下文与记忆服务将系统提示/历史会话的前缀 KV 缓存跨请求复用 (前缀 KV 缓存服务), 并对外提供短期工作记忆与长期存储的分层记忆能力。
💡使用场景
多轮对话、多租户共享系统提示、长期记忆 Agent; 高并发 AI 系统设计面试常考 prompt caching 与记忆分层。
解决的核心痛点
长会话逐轮全量 prefill 使 TTFT 与成本随长度线性膨胀; 前缀缓存把 prefill 计算量由 O(Ltotal)O(L_{\text{total}}) 降至 O(Lnew)O(L_{\text{new}}) (TTFT 可降 80%+), 记忆分层 (短期 KV/上下文窗口 + 长期外部存储与检索) 将长会话成本从“全量复算”压缩为“窗口 + 缓存命中”量级。
🎯5 个高频面试考点 (Exam Points)
1
前缀 KV 缓存 (prompt caching) 如何跨请求复用, 命中率如何影响 TTFT 与成本?
2
短期记忆与长期记忆如何分层存储 (工作记忆 vs 外部向量库)?
3
检索服务 (RAG) 如何与记忆服务集成, 相关度与延迟如何权衡?
4
长会话成本如何控制 (窗口裁剪、摘要压缩、缓存前缀)?
5
系统提示或历史更新后, 前缀缓存如何失效与重建?
📖 关联深度指南:📄 high-concurrency-ai-system
更新于 2026-08-12
🎯
检验攻克程度:针对「上下文缓存与记忆服务」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Agent 运行时(跨模块)下一个知识点RL 训练与推理服务(跨模块)

🔗 更多 AI 基础设施 知识点卡片

激活显存估算弹性伸缩与成本优化检查点与故障恢复集群调度 Ray/K8s