vllm-project/vllmApache-2.0 vLLM:从 PagedAttention 长出来的开源服务栈,200+ 模型架构与五维并行
UC Berkeley Sky Lab 出身、2000+ 贡献者的推理与服务库:分页 KV 显存、连续批处理与分块 prefill、CUDA/HIP 图与 torch.compile、FP8/MXFP4/NVFP4/GGUF 等全量量化、FlashInfer/TRTLLM-GEN/FlashMLA 可插拔注意力核、n-gram/suffix/EAGLE/DFlash 四条投机解码路线、张量/流水线/数据/专家/上下文五维并行与 P/D 分离,同时讲 OpenAI 与 Anthropic 两套协议。
推理引擎ServingPagedAttention