# NInfer：70+ t/s 的速度代价是显存

> NInfer 主打速度极致：单卡 3090 跑 27B 稳定 70+ t/s，远超 llama.cpp。代价是显存占用激进——上下文拉长或多并发时显存就是墙。

![NInfer 推理框架与 3090 单卡部署](/assets/articles/lcz/ninfer/hero.jpg)

> 单卡 3090 跑 NInfer + Qwen3.8 27B，70+ t/s 的速度——但上下文太短，显存是天花板。

## NInfer 是什么

NInfer 是新一代推理框架，主打**速度极致**：在 27B 级别的模型上，单卡 3090 能稳定跑到 70+ t/s，远超 llama.cpp 的常规表现。

## 代价：上下文受限

NInfer 的速度来自激进的 kernel 优化，但**显存占用也很激进**。单卡 3090 上，27B 模型权重 + KV cache 把显存挤得满满当当，留给上下文的空间很小。

具体表现：
- 短上下文（4K 以内）：速度起飞，70+ t/s
- 长上下文（32K+）：显存不够，上下文长度被硬砍
- 多并发：基本跑不了，显存不够分

## 适合什么场景

- **短对话、单轮问答**：速度极致
- **轻量 agent（上下文 < 8K）**：流畅
- **长文档处理（> 32K）**：不适合，显存不够
- **多并发服务**：不适合，需要更大显存

## 一句话

NInfer 是"速度优先"的极端选择。如果你的场景是短上下文、单用户、追求极致速度，它是目前 3090 单卡最快的方案。但一旦上下文拉长或要并发，显存就是墙。


---
来源：https://laobanclaw.top/articles/ninfer-3090-70tps-short-ctx/（AI 军火库）
