返回 大语言模型 思维导图
中文·English
大语言模型ID: speculative-decoding

推测解码(跨模块)

Speculative Decoding (cross-module)
🎯核心定义
推测解码 (Speculative Decoding) 是一种无损加速自回归生成的技术:由轻量草稿模型 (draft model) 一次预测 γ\gamma 个 token,目标大模型并行验证 —— 单次前向同时计算 γ+1\gamma+1 个位置的 logits,接受与草稿一致的前缀,不一致处用接受-拒绝采样修正。加速比 E1αγ1αE \approx \frac{1-\alpha^{\gamma}}{1-\alpha} (α\alpha 为草稿接受率、γ\gamma 为草稿长度);EAGLE/Medusa 直接在目标模型上增加树状多 Head 预测后续 token,免去独立草稿模型。
💡使用场景
在线低延迟推理(自回归逐 token 生成是主要延迟瓶颈);显存带宽受限的推理服务器收益最大(γ\gamma 越大加速越明显);Medusa/EAGLE 因无需额外草稿模型、部署简单,是单模型端最主流的方案。
解决的核心痛点
自回归解码每步只产出 1 个 token,却要读完整套权重矩阵,访存受限、吞吐极低。并行验证把每步有效产出提升到约 11α\frac{1}{1-\alpha} 个 token —— 例如 α=0.8\alpha=0.8γ=4\gamma=4E2.95×E \approx 2.95\times;且接受-拒绝采样保证输出分布与原模型完全一致,是严格无损的加速。
🎯5 个高频面试考点 (Exam Points)
1
加速比公式 E1αγ1αE \approx \frac{1-\alpha^{\gamma}}{1-\alpha}:α\alphaγ\gamma 如何影响加速?
2
为什么推测解码是无损的?接受-拒绝采样如何保证分布不变?
3
草稿模型如何选择?接受率 α 与草稿开销之间的权衡?
4
EAGLE/Medusa 与标准草稿模型的区别?树状多 Head 为什么更优?
5
什么场景收益最大、什么场景收益有限?
📖 关联深度指南:📄 speculative-decoding
更新于 2026-08-12
🎯
检验攻克程度:针对「推测解码(跨模块)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点解码策略下一个知识点KV Cache 管理

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA