M5-090M5: NLP & Large Language ModelsAgents & Tool UseHard
Mastery:

Agents & Tool Use: 解释 Agent 的成本与延迟控制。

📐 Mathematical Definition
cost≈rounds×(context×price+tools);latency serial\text{cost}\approx\text{rounds}\times(\text{context}\times\text{price}+\text{tools});\qquad \text{latency}\ \text{serial}
⚡ Executive Summary
Core Concept: 成本 ∝ 轮数 × 上下文长度 × 工具调用;用上下文压缩、模型分级、缓存、并行与预算上限控制。

📌 Key Takeaways

  • •
    成本随轮数累积(每轮都带完整上下文)
  • •
    上下文增长是主要成本源(历史累积)
  • •
    控制:压缩/摘要、模型分级、缓存、并行、预算上限

📐 Mathematical Derivations

数学机理:<strong>成本结构</strong>——Agent 的成本 ≈ <strong>轮数 × (每轮上下文 token 数 × 单价 + 工具调用成本)</strong>。<strong>关键特性:成本随轮数超线性增长</strong>——因为每轮都要带上<strong>完整的历史</strong>(对话 + 工具结果),故第 k 轮的输入 ≈ 前 k−1 轮的总和;若轮数为 R、每轮新增 N token,则总输入 ≈ N·R(R+1)/2 = <strong>O(R²)</strong>。这使长任务的成本急剧上升(10 轮的成本约是 5 轮的 4 倍以上)。<strong>延迟结构</strong>——Agent 的延迟主要是<strong>串行</strong>的(每轮需等上一轮完成),故总延迟 ≈ 轮数 × 每轮延迟;工具调用(网络)进一步增加延迟。<strong>控制手段</strong>:(1) <strong>上下文压缩</strong>——(a) <strong>摘要</strong>(把旧历史压缩为摘要);(b) <strong>丢弃</strong>(只保留最近 N 轮 + 关键信息);(c) <strong>外部存储</strong>(把历史写入文件/向量库,按需检索);(d) <strong>工具结果截断</strong>(只保留相关部分)。(2) <strong>模型分级(routing)</strong>——用<strong>便宜的小模型</strong>做简单步骤(如工具选择、格式转换)、<strong>强模型</strong>做关键推理;可按 (a) 步骤类型、(b) 难度分类器、(c) 置信度 路由。这能大幅降低成本。(3) <strong>缓存</strong>——(a) <strong>前缀缓存</strong>(相同的历史前缀复用 KV);(b) <strong>结果缓存</strong>(相同工具调用复用结果);(c) <strong>语义缓存</strong>(相似查询复用答案)。(4) <strong>并行化</strong>——(a) <strong>并行工具调用</strong>(互不依赖的调用同时执行);(b) <strong>并行子任务</strong>(多 Agent 并行);(c) 减少串行轮数。(5) <strong>预算控制</strong>——(a) <strong>最大轮数</strong>(防失控);(b) <strong>token 预算</strong>(超出则终止或降级);(c) <strong>成本上限</strong>(超出则报警/停止)。(6) <strong>减少不必要的轮次</strong>——(a) 更好的工具设计(一次调用获取更多信息);(b) 更好的规划(减少试错);(c) 缓存常见路径。<strong>度量</strong>——(a) <strong>每任务成本</strong>(token + 工具调用);(b) <strong>每任务延迟</strong>(P50/P99);(c) <strong>成本-成功率曲线</strong>(指导选型)。<strong>权衡</strong>——(a) 压缩上下文会丢失信息(可能降低成功率);(b) 模型分级可能降低质量;(c) 减少轮数可能牺牲准确性。故需在'成本-质量'间按业务需求选点。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'成本随轮数超线性(O(R²))'是关键洞察</strong>——它解释了为什么长任务 Agent 的成本会失控;故<strong>控制轮数</strong>是第一优先级(通过更好的规划与工具设计减少试错)。② <strong>'上下文压缩'的取舍</strong>——压缩能省成本但可能丢失关键信息;故 (a) 保留'关键决策与结果'、(b) 压缩'过程细节'、(c) 用外部存储保留全文(可检索)。③ <strong>'模型分级'是实用的降本手段</strong>——Agent 的许多步骤(工具选择、结果解析、格式转换)不需要最强模型;用便宜模型可省 5~10 倍成本。④ <strong>'前缀缓存'在 Agent 场景价值巨大</strong>——Agent 每轮都带相同的历史前缀;前缀缓存可大幅降低 prefill 成本(见 M4 的前缀缓存题)。⑤ <strong>'并行工具调用'降低延迟</strong>——对互不依赖的调用可并行;这需要模型支持且系统实现。⑥ <strong>面试要点</strong>——被问'Agent 成本怎么控制',应给出'<strong>成本 ≈ 轮数 × 上下文 × 单价,且随轮数超线性(O(R²))</strong>'这一结构分析,并给出'<strong>上下文压缩 / 模型分级 / 缓存 / 并行 / 预算上限</strong>'五类手段与'<strong>成本-成功率联合评估</strong>';能指出'控制轮数是第一优先级'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    不控制轮数与上下文(成本随任务长度爆炸)
  • ✕
    所有步骤都用最强模型(成本高且无必要)
🎯 Interviewer Follow-ups
  • ?
    为什么 Agent 的成本是超线性的?
  • ?
    如何做模型分级(routing)?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-089: Agents & Tool Use: 解释 Agent 的评估方法。📋Back to BankNext →M5-091: Agents & Tool Use: 解释 Agent 的规划(planning)与任务分解。