从零实现的 C++/CUDA 推理引擎,只服务五个注册 Qwen 权重、只跑一张 RTX 5090:MTP/DFlash 投机解码、五种 KV 存储、24 万 token 上下文与 Device/Host 前缀检查点复用,C=8 聚合解码 1,146.9 tok/s。