推测解码 = 用一个小而快的草稿模型 (draft model) 一次性猜出 γ 个候选 token,再把整段候选交给目标大模型做一次并行验证,接受匹配的 token,未匹配处回退重采样 —— 目标是让每次前向的产出 token 数从 1 变成 >1,把 decode 的带宽瓶颈换成 prefill 的算力并行。流程: ① 草稿模型自回归生成
γ 个候选 token(小模型单步很快);② 目标模型对候选序列做单次前向,并行得到每个位置的真实分布
pi 与草稿分布
qi;③ 从
i=1 开始逐位比较,贪心模式下
pi 的 argmax 等于草稿 token 则接受,否则回退到该位置重新采样;④ 可选 rejection sampling(修改拒绝采样): 以
min(1,pi/qi) 概率接受草稿,拒绝时按
norm(max(0,pi−qi)) 重新采样,保证输出分布与目标模型完全一致(lossless)。加速比公式(接受率
α、草稿长度
γ,每轮有效产出期望):
E≈1−α1−αγ。数值例:
α=0.8, γ=4 →
E=1−0.81−0.84=0.20.5904≈2.95× 加速;可见
γ 增大收益递减(
αγ 趋近 0 后受
1/(1−α) 上限约束),提升接受率比无限加长草稿更有效。变体: EAGLE 用目标模型上一 token 的 hidden state 特征自回归预测下一层特征再映射回词汇分布,草稿质量高(
α 可达 0.7-0.9);Medusa 在模型头部挂多个并行的解码头直接草稿多步,无需独立草稿模型;两者都可用树状验证 (tree attention): 一次前向并行验证多条候选分支,让
α 接近 1 的同时控制验证开销。