ninfer/hero.jpg" alt="NInfer 推理框架与 3090 单卡部署">

单卡 3090 跑 NInfer + Qwen3.8 27B,70+ t/s 的速度——但上下文太短,显存是天花板。

NInfer 是什么

NInfer 是新一代推理框架,主打速度极致:在 27B 级别的模型上,单卡 3090 能稳定跑到 70+ t/s,远超 llama.cpp 的常规表现。

代价:上下文受限

NInfer 的速度来自激进的 kernel 优化,但显存占用也很激进。单卡 3090 上,27B 模型权重 + KV cache 把显存挤得满满当当,留给上下文的空间很小。

具体表现:

适合什么场景

一句话

NInfer 是"速度优先"的极端选择。如果你的场景是短上下文、单用户、追求极致速度,它是目前 3090 单卡最快的方案。但一旦上下文拉长或要并发,显存就是墙。