返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: speculative-decoding

推测解码

Speculative Decoding
🎯核心定义
推测解码 = 用一个小而快的草稿模型 (draft model) 一次性猜出 γ 个候选 token,再把整段候选交给目标大模型做一次并行验证,接受匹配的 token,未匹配处回退重采样 —— 目标是让每次前向的产出 token 数从 1 变成 >1,把 decode 的带宽瓶颈换成 prefill 的算力并行。流程: ① 草稿模型自回归生成 γ\gamma 个候选 token(小模型单步很快);② 目标模型对候选序列做单次前向,并行得到每个位置的真实分布 pip_i 与草稿分布 qiq_i;③ 从 i=1i=1 开始逐位比较,贪心模式下 pip_i 的 argmax 等于草稿 token 则接受,否则回退到该位置重新采样;④ 可选 rejection sampling(修改拒绝采样): 以 min(1,pi/qi)\min(1, p_i/q_i) 概率接受草稿,拒绝时按 norm(max(0,piqi))\text{norm}\left(\max(0, p_i - q_i)\right) 重新采样,保证输出分布与目标模型完全一致(lossless)。加速比公式(接受率 α\alpha、草稿长度 γ\gamma,每轮有效产出期望): E1αγ1αE \approx \frac{1 - \alpha^{\gamma}}{1 - \alpha}。数值例: α=0.8, γ=4\alpha = 0.8,\ \gamma = 4E=10.8410.8=0.59040.22.95×E = \frac{1 - 0.8^4}{1 - 0.8} = \frac{0.5904}{0.2} \approx 2.95\times 加速;可见 γ\gamma 增大收益递减(αγ\alpha^{\gamma} 趋近 0 后受 1/(1α)1/(1-\alpha) 上限约束),提升接受率比无限加长草稿更有效。变体: EAGLE 用目标模型上一 token 的 hidden state 特征自回归预测下一层特征再映射回词汇分布,草稿质量高(α\alpha 可达 0.7-0.9);Medusa 在模型头部挂多个并行的解码头直接草稿多步,无需独立草稿模型;两者都可用树状验证 (tree attention): 一次前向并行验证多条候选分支,让 α\alpha 接近 1 的同时控制验证开销。
💡使用场景
任何 decode 占主流的自回归服务(TTFT 已缓存、吞吐瓶颈在逐 token 生成的场景);vLLM/SGLang/TensorRT-LLM 均内置;面试高频“加速比怎么算”“为什么一次验证是并行的”“EAGLE 与 Medusa 的区别”。
解决的核心痛点
大模型 decode 每步只产 1 个 token 且受限于 HBM 带宽(权重/ KV 读取 ≫ 计算),GPU 算力严重闲置。推测解码用草稿模型把“串行的 1 步”变成“并行的 γ 步验证”,单次前向成本不变(候选 token 一起喂入,矩阵并行摊薄),产出期望从 1 提升到 EE 个 token —— 数值上 2-3 倍吞吐,且 rejection sampling 保证输出分布无损,加速不牺牲质量。
🎯5 个高频面试考点 (Exam Points)
1
写出推测解码流程并手算加速比: 公式 E1αγ1αE \approx \frac{1 - \alpha^{\gamma}}{1 - \alpha};给 α=0.8,γ=4\alpha=0.8,\gamma=4 算出 ≈ 2.95×;解释为什么 γ\gamma 增大收益递减(上限 1/(1α)1/(1-\alpha))。
2
为什么“一次验证 γ 个候选”几乎不增加延迟: 候选 token 单次前向输入、按位置并行计算 logits;比较 decode 串行 1 token 与验证 γ token 的计算特性。
3
rejection sampling 如何保证输出分布与目标模型一致(lossless): 接受概率 min(1,pi/qi)\min(1, p_i/q_i) 与重采样 norm(max(0,piqi))\text{norm}(\max(0, p_i - q_i)) 的数学含义。
4
EAGLE vs Medusa vs 独立小草稿模型: 各自草稿怎么来、接受率高低、是否需要额外训练、树状验证 (tree attention) 如何一次验证多分支。
5
接受率 α\alpha 受什么影响、如何测量与提升;草稿模型与小模型的蒸馏/共享权重策略对吞吐与显存的影响。
📖 关联深度指南:📄 speculative-decoding
更新于 2026-08-12
🎯
检验攻克程度:针对「推测解码」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点KV Cache 与 PagedAttention下一个知识点推理引擎 vLLM/SGLang/TensorRT-LLM

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)弹性伸缩与成本优化检查点与故障恢复