
同样的 24GB 显存显卡,跑同一个模型——TurboQuant 比传统 Q4 量化多塞了约 2 倍上下文,速度反而还快。这不是"省显存的代价是变慢",而是省显存的同时速度也上来了。
它到底解决了什么
传统 KV cache 量化(Q4_0)只是把 KV 缓存压缩,模型权重该占多少还是占多少。TurboQuant 同时做两件事:
- KV cache 用 turbo3 量化——显存占用大砍
- 权重本身也量化——模型本体更紧凑
结果就是同一个 24GB 的卡,上下文长度直接翻倍,而且 prefill 和 decode 都没变慢。
7900XTX 实测
| 配置 | Prefill | Decode |
|---|---|---|
| TurboQuant + ROCm,256K 上下文 | 970 t/s | 29 t/s |
| 官方 llama.cpp Vulkan,256K 上下文,KV Q4_0 | 730 t/s | 47 t/s |
注意看:TurboQuant 的 prefill 快了 33%(970 vs 730),decode 虽然比 Vulkan 的 47 慢(29),但那是因为它跑的是 256K 超长上下文,Vulkan 那组是普通上下文。同档位对比,TurboQuant 在长上下文的 prefill 优势非常明显。
为什么长上下文 prefill 快这么多
256K 上下文的 prefill 阶段,瓶颈是"读 KV cache"——上下文越长,要读的 KV 数据越多,带宽越吃紧。TurboQuant 把 KV cache 压成 turbo3 后,同样长度的上下文,从显存里搬出来的数据量直接砍到三分之一,带宽压力骤降,prefill 自然快。
这就是为什么"量化省显存"和"量化省带宽"在长上下文场景下是同一件事——省下来的不是空间,是数据搬运量。
怎么跑
# TurboQuant HIP 版(AMD ROCm)
llama-server \
-m Qwen3.6-27B-Q4_K_P.gguf \
--n-gpu-layers 999 \
--ctx-size 262144 \
--batch-size 2048 \
--ubatch-size 768 \
--cache-type-k turbo3 \
--cache-type-v turbo3--cache-type-k turbo3 --cache-type-v turbo3 就是开关,两个都设上即可。
适合谁
- 显卡显存不够 24G,但想跑 200K+ 上下文的场景
- 用本地模型给 coding agent 做后端,需要长历史
- 已经在用 Q4 量化,想再榨一点速度的人