
DSpark:置信度调度的半自回归投机解码
DeepSeek 与北大提出的投机解码框架,同时清理草稿侧与验证侧的两笔浪费。草稿侧用「重的并行主干 + 极轻的串行头」补回块内 token 依赖,缓解并行草稿的后缀衰减;验证侧让草稿模型顺带预测每个位置的条件存活概率,经 STS 后验校准后,由读硬件吞吐曲线 SPS(B) 的调度器把验证长度当作全局吞吐最大化变量逐请求求解。离线接受长度比 Eagle3 高 30.9%/26.7%/30.0%、比 DFlash 高 16.3%/18.4%/18.3%,串行头只增加 0.2%-1.3% 整轮延迟。已在 DeepSeek-V4-Flash 与 V4-Pro 预览版生产系统上线并替换 MTP-1:同等吞吐下每用户生成速度快 60%-85%,严格交互性 SLA 下仍维持非退化的服务能力。代码与全部草稿权重已在 DeepSpec 开源(MIT)。
Xin Cheng, Xingkai Yu, Chenze Shao2026年7月6日
Speculative DecodingLLM InferenceLLM Serving2026年7月6日
