投机采样与草稿模型推理加速架构 (Speculative Decoding & Draft-Model Inference Acceleration Architecture) 是在不改变大模型原始输出概率分布的前提下,利用计算密集度换取显存带宽读取瓶颈、将大模型单 Token 生成速度提升 2~3 倍的无损加速算法;核心机制:1) 草稿模型推测生成 (Draft Propose): 采用极小、极快的草稿小模型(如 1B 的 Draft Model)以极快速度自回归预测生成后续
K 个 Candidate Tokens;2) 目标大模型并行验证 (Target Parallel Verify): 将原始 Prompt 与草稿模型生成的
K 个候选 Token 打包为单次前向传播送入目标大模型(70B Target Model),目标模型利用其极高的矩阵并行算力在单次前向内同时计算出这
K 个 Token 的目标条件概率分布;3) 拒绝采样概率校验 (Rejection Sampling): 按照接受概率判定条件
αi=min(1,Pdraft(xi)Ptarget(xi)) 依次决定是否接受每个 Token,若中途拒绝则重新采样一个修正 Token 并放弃后续推测,数学证明最终输出分布与纯大模型完全等价。