本地部署最现实的问题:想要的模型比显存大。这篇讲清楚"显存不够"时各手段的真实效果,避免走弯路。
一、量化:性价比最高的第一步
量化就是把模型权重从 16 位压到 4~8 位。Q4 量化后,模型体积约为原参数的 0.5 倍左右——27B 模型 Q4 量化后约 16GB 出头,32GB 显存轻松装下。
精度取舍的经验:
- Q4:日常对话、RAG 知识库场景几乎无感损失,是默认选择
- Q5/Q6:对输出质量敏感的场景(写作、推理链长)值得升级,但显存要多花 30%~50%
- FP16 原版:消费级/工作站显卡基本别考虑,除非模型很小
二、CPU offload:能用,但要懂它的代价
offload 是把部分层放到内存/CPU 上,显存放不下时的兜底方案。但代价是速度:CPU 参与的层,速度可能是 GPU 的几分之一到几十分之一。
- 少量 offload(前几层)影响有限,适合"显存差一点"的情况
- 大量 offload 基本等于用 CPU 跑,体验会显著下降
三、层切分:一个常见的误区
很多人以为把模型层切到多张 GPU 上能"翻倍"速度。实际效果取决于卡间互连带宽——普通 PCIe 互连带宽远小于单卡显存带宽,切分带来的通信开销往往吃掉大部分收益。单卡装得下就单卡跑,跨卡切分只在"一张卡装不下、且对速度不敏感"时考虑。
另外注意:跨厂商组多卡(比如 Intel Arc + AMD 混插)没有可用的互连方案,等于两张卡各跑各的,不要投入。
四、32GB 显存的实用组合(R9700 实测思路)
| 需求 | 建议配置 |
|---|---|
| 对话/Agent | 27B Q4 全量 GPU |
| 长上下文(128K+) | 量化模型 + KV cache 优化,必要时少量 offload |
| 跑不动更大的模型 | 换 7B~14B 的 Q8 也比 27B 大量 offload 快 |
核心原则:速度优先选"装得下的最大量化模型",而不是"勉强 offload 的更大模型"。显存是本地部署的第一约束,围绕它做决策。