TensorRT-LLM 是 NVIDIA 官方的 LLM 推理引擎,核心是深度优化的内核融合(Kernel Fusion)+ INT4/FP8 量化 + 预编译引擎,把端到端延迟压到纳秒级,充分发挥单卡 NVIDIA GPU 的全部算力,是 N 卡生态里的性能天花板。在 Llama-3-8B / A100-80G 社区实测中,它的短序列吞吐约 250 tokens/s(领先 vLLM 约 37%),首 Token 延迟仅 32ms(领先约 33%);在 FP8 量化下大模型(如 Llama-405B)的吞吐可达 vLLM 的约 2.1 倍。配合 Triton 推理服务器可提供企业级 SLA 保障,特别适合金融交易、实时对话这类对延迟极度敏感的场景。限制也很硬:仅支持 NVIDIA 平台,国产 GPU 或非 CUDA 环境无法使用,部署需要预编译,门槛较高。
大模型部署
TensorRT-LLM (NVIDIA)
NVIDIA 内核融合 + INT4/FP8 量化 + 预编译,N 卡延迟敏感场景性能天花板
免费开源