大模型 Agent 上下文窗口动态预算分配与长任务记忆压缩机制 (Context Window Token Budgeting & Progressive Memory Compaction) 是将宝贵的有限上下文窗口当作“稀缺系统内存”进行严格预算与分页压缩的核心工程技术;核心分层预算模型:设定固定预算池(如 8k/32k 窗口):System Prompt 与核心工具定义(预留 20% 静态预算)、动态工作记忆(预留 50% 用于存放最近 3 轮完整 Tool / Output Trace)、输出缓冲区(预留 20% 生成空间)、安全余量(预留 10% 缓冲);记忆压缩 (Compaction) 策略:当动态工作记忆达到阈值上限时,触发渐进式压缩——1) 滚动滑动窗口截断 (Sliding Window Truncation: 仅保留最近
K 条消息);2) 语义递归摘要 (Recursive Summarization: 调用快速轻量小模型将早期 10 轮历史对话压缩为高密度 Structured State Summary);3) 工具结果裁剪 (Tool Output Pruning: 对返回数万行的 API 响应截取关键字段,原文档存入向量库)。