TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
AI 基础设施 思维导图
›
上下文缓存与记忆服务
← 返回 AI 基础设施 思维导图
中文
·
English
🖥️ AI 基础设施
ID:
context-memory-service
上下文缓存与记忆服务
Context & Memory Services
🎯
核心定义
上下文与记忆服务将系统提示/历史会话的前缀 KV 缓存跨请求复用 (前缀 KV 缓存服务), 并对外提供短期工作记忆与长期存储的分层记忆能力。
💡
使用场景
多轮对话、多租户共享系统提示、长期记忆 Agent; 高并发 AI 系统设计面试常考 prompt caching 与记忆分层。
⚡
解决的核心痛点
长会话逐轮全量 prefill 使 TTFT 与成本随长度线性膨胀; 前缀缓存把 prefill 计算量由
O
(
L
total
)
O(L_{\text{total}})
O
(
L
total
)
降至
O
(
L
new
)
O(L_{\text{new}})
O
(
L
new
)
(TTFT 可降 80%+), 记忆分层 (短期 KV/上下文窗口 + 长期外部存储与检索) 将长会话成本从“全量复算”压缩为“窗口 + 缓存命中”量级。
🎯
5 个高频面试考点 (Exam Points)
1
前缀 KV 缓存 (prompt caching) 如何跨请求复用, 命中率如何影响 TTFT 与成本?
2
短期记忆与长期记忆如何分层存储 (工作记忆 vs 外部向量库)?
3
检索服务 (RAG) 如何与记忆服务集成, 相关度与延迟如何权衡?
4
长会话成本如何控制 (窗口裁剪、摘要压缩、缓存前缀)?
5
系统提示或历史更新后, 前缀缓存如何失效与重建?
📖 关联深度指南:
📄 high-concurrency-ai-system →
更新于 2026-08-12
🎯
检验攻克程度:针对「上下文缓存与记忆服务」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
Agent 运行时(跨模块)
下一个知识点 →
RL 训练与推理服务(跨模块)
🔗 更多 AI 基础设施 知识点卡片
激活显存估算
弹性伸缩与成本优化
检查点与故障恢复
集群调度 Ray/K8s