NVIDIA/TensorRT-LLMNOASSERTION TensorRT-LLM:NVIDIA 的专用核与机架级并行引擎,把 agentic 服务做成一等议题
NVIDIA 的 LLM 与视觉生成推理优化库,2025-03-22 起完全开源。28 篇技术博客构成一份可查的工程账本:Skip Softmax 与稀疏注意力压长上下文、专家并行三部曲与 NVLink 单边 AlltoAll、NVL72 的 DWDP、引导解码与投机解码协作、推理时计算,以及用 trace 回放与作业级指标评估 agentic 服务。宣称 Llama 4 Maverick 单用户破 1000 TPS、B200 上超 40000 tok/s,Bing 与 NAVER Place 在生产使用。
推理引擎CUDAKernels