投机解码
Speculative Decoding进阶先让小模型快速猜几个 token,再让大模型一次并行核对,结果不变、速度更快。
投机解码是大模型推理加速技术,2022 年底由谷歌的 Leviathan 等人提出(ICML 2023),DeepMind 的 Chen 等人同期提出了思路相同的「推测采样」。自回归模型每生成一个 token 都要把大模型完整跑一遍,很慢。投机解码先用便宜的草稿模型连续猜出几个 token,再让大模型在一次前向里并行给它们打分,按特定的接受规则保留猜对的前缀、从第一个不对的位置重新采样;这样输出分布与大模型单独生成完全一致,也不用重新训练。谷歌在 T5-XXL 上测到 2–3 倍加速。具身智能里,OpenVLA 这类输出离散动作 token 的 VLA 也用它降低推理延迟,2026 年还出现了结合运动学信息的改进方法。
例子Spec-VLA(EMNLP 2025)发现直接套用标准投机解码对 VLA 提速有限,于是利用动作 token 之间的相对距离放宽接受条件,在 OpenVLA 上把接受长度提高 44%,加速 1.42 倍且成功率不降。
- 也叫
- 推测解码、推测采样、Speculative Sampling
- 相关
- 自回归解码、推理延迟、并行解码、KV 缓存、视觉-语言-动作模型、OpenVLA
- 来源
- Fast Inference from Transformers via Speculative Decoding (arXiv:2211.17192)
Accelerating Large Language Model Decoding with Speculative Sampling (arXiv:2302.01318)
Spec-VLA: Speculative Decoding for Vision-Language-Action Models with Relaxed Acceptance (arXiv:2507.22424) - 信息截至
- 2026-03