ninfer/hero.jpg" alt="NInfer 推理框架与 3090 单卡部署">
单卡 3090 跑 NInfer + Qwen3.8 27B,70+ t/s 的速度——但上下文太短,显存是天花板。
NInfer 是什么
NInfer 是新一代推理框架,主打速度极致:在 27B 级别的模型上,单卡 3090 能稳定跑到 70+ t/s,远超 llama.cpp 的常规表现。
代价:上下文受限
NInfer 的速度来自激进的 kernel 优化,但显存占用也很激进。单卡 3090 上,27B 模型权重 + KV cache 把显存挤得满满当当,留给上下文的空间很小。
具体表现:
- 短上下文(4K 以内):速度起飞,70+ t/s
- 长上下文(32K+):显存不够,上下文长度被硬砍
- 多并发:基本跑不了,显存不够分
适合什么场景
- 短对话、单轮问答:速度极致
- 轻量 agent(上下文 < 8K):流畅
- 长文档处理(> 32K):不适合,显存不够
- 多并发服务:不适合,需要更大显存
一句话
NInfer 是"速度优先"的极端选择。如果你的场景是短上下文、单用户、追求极致速度,它是目前 3090 单卡最快的方案。但一旦上下文拉长或要并发,显存就是墙。