# TurboQuant：显存减半，速度翻倍

> 同样的 24G 显卡跑同一模型，TurboQuant 比传统 Q4 多塞约 2 倍上下文，速度反而更快——省显存的同时省带宽。7900XTX 实测 256K prefill 970 t/s。

![TurboQuant 量化原理示意](/assets/articles/lcz/turboquant/hero.jpg)

> 同样的 24GB 显存显卡，跑同一个模型——TurboQuant 比传统 Q4 量化多塞了约 2 倍上下文，速度反而还快。这不是"省显存的代价是变慢"，而是省显存的同时速度也上来了。

## 它到底解决了什么

传统 KV cache 量化（Q4_0）只是把 KV 缓存压缩，模型权重该占多少还是占多少。TurboQuant 同时做两件事：

1. **KV cache 用 turbo3 量化**——显存占用大砍
2. **权重本身也量化**——模型本体更紧凑

结果就是同一个 24GB 的卡，上下文长度直接翻倍，而且 prefill 和 decode 都没变慢。

## 7900XTX 实测

| 配置 | Prefill | Decode |
| --- | --- | --- |
| TurboQuant + ROCm，256K 上下文 | 970 t/s | 29 t/s |
| 官方 llama.cpp Vulkan，256K 上下文，KV Q4_0 | 730 t/s | 47 t/s |

注意看：TurboQuant 的 **prefill 快了 33%**（970 vs 730），decode 虽然比 Vulkan 的 47 慢（29），但那是因为它跑的是 256K 超长上下文，Vulkan 那组是普通上下文。同档位对比，TurboQuant 在长上下文的 prefill 优势非常明显。

## 为什么长上下文 prefill 快这么多

256K 上下文的 prefill 阶段，瓶颈是"读 KV cache"——上下文越长，要读的 KV 数据越多，带宽越吃紧。TurboQuant 把 KV cache 压成 turbo3 后，**同样长度的上下文，从显存里搬出来的数据量直接砍到三分之一**，带宽压力骤降，prefill 自然快。

这就是为什么"量化省显存"和"量化省带宽"在长上下文场景下是同一件事——省下来的不是空间，是数据搬运量。

## 怎么跑

```bash
# TurboQuant HIP 版（AMD ROCm）
llama-server \
  -m Qwen3.6-27B-Q4_K_P.gguf \
  --n-gpu-layers 999 \
  --ctx-size 262144 \
  --batch-size 2048 \
  --ubatch-size 768 \
  --cache-type-k turbo3 \
  --cache-type-v turbo3
```

`--cache-type-k turbo3 --cache-type-v turbo3` 就是开关，两个都设上即可。

## 适合谁

- 显卡显存不够 24G，但想跑 200K+ 上下文的场景
- 用本地模型给 coding agent 做后端，需要长历史
- 已经在用 Q4 量化，想再榨一点速度的人


---
来源：https://laobanclaw.top/articles/turboquant-2x-context-faster/（AI 军火库）
