M5-122M5: NLP & Large Language ModelsInference-Time Compute & ScalingHard
Mastery:
Inference-Time Compute & Scaling: 如何为推理时计算做成本-收益决策?
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 比较'增加推理算力'与'换更大模型'的边际收益;按难度分层、按任务类型选形式,并用 goodput 评估。
📌 Key Takeaways
- •比较边际收益:推理算力的 Δacc/Δcost vs 换模型的 Δacc/Δcost
- •按难度分层(简单少算、难题多算)
- •按任务类型选形式(验证/投票/长 CoT);用 goodput 评估
📐 Mathematical Derivations
数学机理:<strong>决策框架(三步)</strong>。<strong>第一步:明确目标与约束</strong>——(a) <strong>质量目标</strong>(准确率下限);(b) <strong>成本约束</strong>(每请求的成本/延迟上限);(c) <strong>请求量</strong>(决定'持续成本'的权重)。<strong>第二步:比较边际收益</strong>——对每个可选方案计算'边际收益'Δacc/Δcost:(a) <strong>方案 A:增加推理算力</strong>(更多采样/更长 CoT)——边际收益递减(见 1−(1−p)^N 的曲线);(b) <strong>方案 B:换更大的模型</strong>——边际收益也递减(scaling law 的幂律);(c) <strong>方案 C:更好的提示/工具/RAG</strong>——常是<strong>最高性价比</strong>(一次性优化、持续收益)。选择<strong>边际收益最高</strong>的方案。<strong>第三步:按难度与任务类型分配</strong>——(a) <strong>按难度</strong>——简单问题用<strong>零算力</strong>(直答或小模型)、中等用<strong>中等算力</strong>(长 CoT)、难题用<strong>高算力</strong>(多采样 + 验证);这需要<strong>难度估计</strong>(可用模型自评、小分类器、或'试探性生成')。(b) <strong>按任务类型</strong>——可验证 → best-of-N + 程序验证;可比较 → Self-Consistency;开放式 → 长 CoT / 多轮修正;知识型 → 检索/工具(而非加推理算力)。<strong>评估指标</strong>——(a) <strong>goodput</strong>(在质量/延迟 SLO 内的有效吞吐);(b) <strong>成本-质量帕累托前沿</strong>(而非单点);(c) <strong>每美元的正确率</strong>(经济性)。<strong>实践要点</strong>——(1) <strong>先优化'免费'的部分</strong>——更好的 prompt、工具、RAG、约束解码(一次优化、持续收益);这些通常<strong>优于</strong>'加推理算力'。(2) <strong>避免'对所有问题用最高算力'</strong>——成本会爆炸而收益递减。(3) <strong>难度估计的实现</strong>——(a) 用一个小模型/分类器预测难度;(b) 让模型'先尝试简短回答,若不确定再加算力'(级联);(c) 用启发式(问题长度、类型)。(4) <strong>级联(cascade)</strong>——先用廉价方案(小模型/少算力),只对'失败/不确定'的样本升级(用验证器或置信度触发);这是<strong>最经济</strong>的架构。(5) <strong>测量而非假设</strong>——不同任务/模型的边际收益不同,需实测(A/B)。<strong>典型结论</strong>——(a) 对<strong>高频简单任务</strong>:小模型 + 零/少算力;(b) 对<strong>低频困难任务</strong>:大模型 + 多算力;(c) 对<strong>中等任务</strong>:级联(先便宜后升级)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'先优化免费的部分'是首要原则</strong>——更好的 prompt/工具/RAG 是一次性投入、持续收益;常优于'加推理算力'(后者每次请求都付费)。故应<strong>先做工程优化,再加算力</strong>。② <strong>'级联'是最经济的架构</strong>——用廉价方案处理大部分请求、只对困难样本升级;这比'对所有请求用高算力'便宜得多,且质量接近。③ <strong>'难度估计'是级联的前提</strong>——需要可靠地判断'这个问题难不难';可用 (a) 模型自评、(b) 小分类器、(c) 置信度/一致性(不确定则升级)。④ <strong>'边际收益递减'是普遍规律</strong>——无论加算力还是换模型,收益都递减;故应<strong>比较边际</strong>(而非总量)。⑤ <strong>'成本结构'决定选择</strong>——推理算力是持续成本(∝请求量),模型规模是一次性 + 持续;故高频服务更看重'每请求成本'(倾向小模型 + 少算力或级联)。⑥ <strong>面试要点</strong>——被问'推理算力该加多少',应给出'<strong>三步框架(目标约束 → 比较边际收益 → 按难度/类型分配)+ goodput + 级联 + 先优化免费部分</strong>',并强调'<strong>边际收益递减、需实测</strong>';能指出'级联是最经济的架构'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕对所有问题用最高推理算力(成本爆炸)
- ✕不比较'换模型'与'加算力'的边际收益
🎯 Interviewer Follow-ups
- ?什么情况下'换更大模型'比'加推理算力'划算?
- ?如何估计问题的难度?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.