FEATURED · 精选文章
部署教程NInfer 深度解析:专为单张 5090 而生的 C++/CUDA 推理引擎
NInfer 是从头用 C++/CUDA 写的单 GPU 推理引擎,定位明确——榨干单张 RTX 5090 上的 Qwen 系列推理(Qwen3.6/3.8,文/图/视频)。本文对比它与 vLLM/SGLang 通用引擎的根本区别,拆解"单卡+单模型"为何能榨出性能,给出选型建议、与 Strata 的上下游关系与踩坑记录。
KNOWLEDGE & PRACTICE
从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。
FEATURED · 精选文章
部署教程NInfer 是从头用 C++/CUDA 写的单 GPU 推理引擎,定位明确——榨干单张 RTX 5090 上的 Qwen 系列推理(Qwen3.6/3.8,文/图/视频)。本文对比它与 vLLM/SGLang 通用引擎的根本区别,拆解"单卡+单模型"为何能榨出性能,给出选型建议、与 Strata 的上下游关系与踩坑记录。
LATEST ARTICLES · 其余文章