四款主流推理框架 2026 年 10 月实时数据对比:vLLM 9.3 万星、Ollama 18.2 万星、SGLang 3.7 万星、TensorRT-LLM 1.5 万星——从吞吐量、显存效率、上手成本到适用场景,一张表说清该选谁。
结论先行
| 场景 | 首选 | 备选 |
|---|---|---|
| 生产 API 服务(高并发) | vLLM | SGLang |
| 超长上下文 / 结构化输出重 | SGLang | vLLM |
| 极致单卡延迟(N 卡) | TensorRT-LLM | vLLM |
| 本地个人使用 / 跨平台 | Ollama | llama.cpp |
| AMD 卡(ROCm) | Ollama / vLLM | SGLang(ROCm 支持中) |
实时数据(2026-10-04,GitHub API)
| 框架 | Star | 最近推送 | 定位 |
|---|---|---|---|
| Ollama | 182,183 | 2026-10-04 | 本地部署首选,跨平台,上手零门槛 |
| vLLM | 93,168 | 2026-10-04 | PagedAttention 发明者,吞吐量标杆 |
| SGLang | 36,775 | 2026-10-04 | RadixAttention,长上下文/多轮对话优化 |
| TensorRT-LLM | 14,762 | 2026-10-04 | NVIDIA 官方,N 卡极限性能 |
| LMDeploy | 8,106 | 2026-09-28 | 书生生态,INT4 量化推理强 |
各框架一句话定位(推断,非官方口径)
- Ollama:'跑起来'最重要时选它。不支持复杂并发调度,但跨平台(N 卡/AMD/Apple)覆盖最广,个人开发者 90% 的场景够用。
- vLLM:PagedAttention 把显存碎片问题解决了,高并发下吞吐量仍是标杆;缺点是 ROCm 支持落后 CUDA 一到两个版本。
- SGLang:RadixAttention 对共享前缀(多轮对话、few-shot)的 KV 复用做得最细,长上下文场景延迟优势明显;Python 前端 + 高性能调度后端的双层架构。
- TensorRT-LLM:N 卡极限性能(FP8/INT4 + 深度编译优化),但工程门槛最高——要写构建脚本、吃 NVIDIA 软件栈,AMD 用户直接排除。
- LMDeploy:INT4 W8A8 量化推理吞吐激进,适合国产卡 + 高吞吐批处理。
选型决策树
需要高并发 API 服务?
├─ 是 → N 卡为主?
│ ├─ 是 → 追求极限:TensorRT-LLM;求稳通用:vLLM
│ └─ 否(有 AMD)→ vLLM(ROCm)或 Ollama
└─ 否 → 个人本地使用?
├─ 是 → Ollama(跨平台)/ LM Studio(GUI)
└─ 否 → 长上下文/多轮重 → SGLang;批处理量化重 → LMDeploy常见误区
- 拿 Ollama 跑生产 API:Ollama 的并发调度和流控不是为高并发设计的,生产环境请用 vLLM/SGLang。
- 以为 TensorRT-LLM 支持 AMD:它绑定 NVIDIA 软件栈,ROCm 用户没有退路。
- 只比 decode 速度不比 prefill:多轮对话场景 prefill 复用(KV cache)才是延迟大头,SGLang 的 RadixAttention 就在这块。
数据来源:GitHub API(2026-10-04 实时拉取)。星标数与更新时间为事实;'定位'段落为编辑部基于公开文档与社区反馈的推断。