# 显存不够时怎么办：量化与 CPU offload 实战策略

> 32GB 显存下跑 27B 模型的实用策略：量化精度取舍、offload 机制原理、层切分的真实效果与常见误区。

本地部署最现实的问题：想要的模型比显存大。这篇讲清楚"显存不够"时各手段的真实效果，避免走弯路。

## 一、量化：性价比最高的第一步

量化就是把模型权重从 16 位压到 4~8 位。Q4 量化后，模型体积约为原参数的 0.5 倍左右——27B 模型 Q4 量化后约 16GB 出头，32GB 显存轻松装下。

精度取舍的经验：

- **Q4**：日常对话、RAG 知识库场景几乎无感损失，是默认选择
- **Q5/Q6**：对输出质量敏感的场景（写作、推理链长）值得升级，但显存要多花 30%~50%
- **FP16 原版**：消费级/工作站显卡基本别考虑，除非模型很小

## 二、CPU offload：能用，但要懂它的代价

offload 是把部分层放到内存/CPU 上，显存放不下时的兜底方案。但代价是速度：CPU 参与的层，速度可能是 GPU 的几分之一到几十分之一。

- 少量 offload（前几层）影响有限，适合"显存差一点"的情况
- 大量 offload 基本等于用 CPU 跑，体验会显著下降

## 三、层切分：一个常见的误区

很多人以为把模型层切到多张 GPU 上能"翻倍"速度。实际效果取决于卡间互连带宽——普通 PCIe 互连带宽远小于单卡显存带宽，切分带来的通信开销往往吃掉大部分收益。**单卡装得下就单卡跑**，跨卡切分只在"一张卡装不下、且对速度不敏感"时考虑。

另外注意：跨厂商组多卡（比如 Intel Arc + AMD 混插）没有可用的互连方案，等于两张卡各跑各的，不要投入。

## 四、32GB 显存的实用组合（R9700 实测思路）

| 需求 | 建议配置 |
|---|---|
| 对话/Agent | 27B Q4 全量 GPU |
| 长上下文（128K+） | 量化模型 + KV cache 优化，必要时少量 offload |
| 跑不动更大的模型 | 换 7B~14B 的 Q8 也比 27B 大量 offload 快 |

核心原则：**速度优先选"装得下的最大量化模型"，而不是"勉强 offload 的更大模型"**。显存是本地部署的第一约束，围绕它做决策。

---
来源：https://laobanclaw.top/articles/vram-shortage-quantization-strategy/（AI 军火库）
