推测解码(Speculative Decoding)

Speculative Decoding
技术原理
推理加速模型优化

推测解码(Speculative Decoding)是一种大模型推理加速技术,核心思想是「用小模型猜,用大模型验」。

工作原理

1. 草稿阶段:用一个轻量级小模型快速生成 3-5 个候选 token 2. 验证阶段:大模型一次性并行验证这些候选 token 3. 接受或拒绝:接受的 token 直接输出,被拒绝的由大模型重新生成

为什么能加速

大模型的推理瓶颈在显存带宽而非计算,推测解码让大模型一次验证多个 token,充分利用并行计算能力。

关键优势

无损加速(数学上保证)、通常 2-3 倍加速、最优可达 3.5 倍。

2025-2026 发展

Medusa 头、Eagle/EAGLE-2、vLLM/TensorRT-LLM/llama.cpp 均已内置支持。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0