TurboQuant 量化原理示意

同样的 24GB 显存显卡,跑同一个模型——TurboQuant 比传统 Q4 量化多塞了约 2 倍上下文,速度反而还快。这不是"省显存的代价是变慢",而是省显存的同时速度也上来了。

它到底解决了什么

传统 KV cache 量化(Q4_0)只是把 KV 缓存压缩,模型权重该占多少还是占多少。TurboQuant 同时做两件事:

  1. KV cache 用 turbo3 量化——显存占用大砍
  2. 权重本身也量化——模型本体更紧凑

结果就是同一个 24GB 的卡,上下文长度直接翻倍,而且 prefill 和 decode 都没变慢。

7900XTX 实测

配置 Prefill Decode
TurboQuant + ROCm,256K 上下文 970 t/s 29 t/s
官方 llama.cpp Vulkan,256K 上下文,KV Q4_0 730 t/s 47 t/s

注意看:TurboQuant 的 prefill 快了 33%(970 vs 730),decode 虽然比 Vulkan 的 47 慢(29),但那是因为它跑的是 256K 超长上下文,Vulkan 那组是普通上下文。同档位对比,TurboQuant 在长上下文的 prefill 优势非常明显。

为什么长上下文 prefill 快这么多

256K 上下文的 prefill 阶段,瓶颈是"读 KV cache"——上下文越长,要读的 KV 数据越多,带宽越吃紧。TurboQuant 把 KV cache 压成 turbo3 后,同样长度的上下文,从显存里搬出来的数据量直接砍到三分之一,带宽压力骤降,prefill 自然快。

这就是为什么"量化省显存"和"量化省带宽"在长上下文场景下是同一件事——省下来的不是空间,是数据搬运量。

怎么跑

# TurboQuant HIP 版(AMD ROCm)
llama-server \
  -m Qwen3.6-27B-Q4_K_P.gguf \
  --n-gpu-layers 999 \
  --ctx-size 262144 \
  --batch-size 2048 \
  --ubatch-size 768 \
  --cache-type-k turbo3 \
  --cache-type-v turbo3

--cache-type-k turbo3 --cache-type-v turbo3 就是开关,两个都设上即可。

适合谁