# V100 32G 本地大模型部署与调优全指南：验卡、散热、驱动到调优

> 32GB 显存档里价格最低的方案：Volta 架构、HBM2 900GB/s、250W 单 8pin。本文记录完整链路——Mats 验卡 + 24 小时烤机、双 12cm 风道散热整备、Windows 535 专业驱动、32GB 三层承载范围，以及双卡显卡坞方案的真实面貌。

V100 32G 是 32GB 显存档里价格最低的方案之一：Volta 架构、HBM2 显存、900GB/s 带宽、250W 功耗，单 8pin 供电就能带起来。这篇把从验卡、散热整备、驱动到部署调优的全链路整理出来——这是一篇"老卡怎么用"的完整记录，所有坑都来自社区真实翻车经历。

## 一、为什么是 V100 32G：32GB 容量前提下的性价比逻辑

| 32GB 档方案 | 显存 | 带宽 | 功耗 | 关键短板 |
|---|---|---|---|---|
| RTX 4090 48G 魔改 | 48GB(魔改) | 1008 GB/s | 450W+ | 魔改风险、价格 |
| RTX 5090 | 32GB | 1792 GB/s | 575W | 全新价贵、消费卡非为 7x24 设计 |
| V100 32G | 32GB HBM2 | 900 GB/s | 250W | 无显示输出、无原生散热、架构老 |
| L20 / A6000 | 48GB | 更高 | 更高 | 价格跳档 |

V100 的规格放到今天跑本地推理依然能打：自带 Tensor Core，FP16 算力约 112 TFLOPS，**HBM2 显存带宽 900GB/s + 低功耗 + 单 8pin 供电**，是 7x24 小时长期运行最友好的架构之一。

明确短板（买之前就要接受）：
- **不支持 BF16**：新模型如果直接用 BF16 权重，要转成 FP16 跑
- **INT4 量化对 Tensor Core 的加速支持远不如新架构**，量化收益比 3090/4090 小
- **没有显示输出接口**，需要另配核显或亮机卡
- **没有风扇**，整卡靠服务器机箱暴力风道被动散热，进台式机必须自己改散热

## 二、验卡：Mats 是必修课

二手计算卡水很深，大量从服务器机房退役，长期高负载运行过。验卡流程：

1. **Mats 显存测试**（NVIDIA 官方工具）：原理是向显存每个地址反复写入/读取特定数据模式并比对，任何一颗显存颗粒、数据线或供电模块有隐患大概率会暴露。
   - U 盘引导精简 Linux，跑支持 Volta 架构的版本
   - 输出出现 FAIL 会附地址和 bit 信息（如 `FAIL at address 0x12345678, expected 0xFFFFFFFF found 0xFF7FFFFF`），可直接定位坏颗粒
   - **PASS 也不要立刻放心**——Mats 只是第一道关卡，接着跑 20 分钟以上连续压力测试，确认显存温度上来后依然稳定
2. 测试报错直接退换，显存问题几乎无法软件修复，别信"刷个 BIOS 就好"
3. 核心/显存频率能否长时间稳定在标称值

## 三、散热整备：这张卡最核心的"组装"工作

V100 PCIe 版整卡沉甸甸的，正面一大片铝鳍片，**没有风扇**。直接放台式机，满载跑大模型五分钟就能飙到 100°C 以上。

社区验证过的低成本方案（实测环境温度 25°C 下核心 75°C 上下、显存 <85°C）：
- 保留原厂铝鳍片，不换水冷（控制成本复杂度）
- 鳍片一侧扎带固定两个 12cm 风扇，一进一出形成穿过鳍片的水平风道
- 背板侧加小尺寸涡轮风扇带走供电模块热量
- 塔式侧透机箱 + 显卡竖装，腾出上下空间避免风道被硬盘架挡住

供电：单 8pin，额定 250W。**750W 金牌电源单拉一根 8pin 显卡供电线，别用 6pin 转 8pin 转接头**（接触电阻大，高负载发热甚至烧毁）。

## 四、驱动：混合显卡机器上最容易翻车的环节

V100 没有显示输出，机器里必然"一张卡负责显示、一张卡负责计算"，驱动和软件调度稍有不慎就出问题。

**Windows 11 建议直接用 535 系列专业驱动**——不是玄学，是实测：Volta 架构在新版驱动下偶尔出现驱动服务崩溃、掉驱动（尤其睡眠唤醒后 `nvidia-smi` 报 `Unable to determine the number of GPUs`），535 分支打磨稳定，连续三天压力测试零掉线。

安装步骤（避免新手踩坑）：
1. DDU 在安全模式下彻底卸载旧驱动（尤其之前装过 Game Ready，残留容易冲突）
2. 重启后装 535 专业驱动，自定义安装，**只装图形驱动 + CUDA 组件**，不装 HD 音频、PhysX
3. `nvidia-smi` 确认识别 V100、显存 32768MiB、驱动/CUDA 版本正常

## 五、32GB 能装多大：分层看体验

| 层级 | 模型 | 显存占用 | 32GB 体验 |
|---|---|---|---|
| 第一层 | 7B-14B（FP16 甚至可原精度） | 16-28GB | 无压力，上下文拉到 16K-32K 不用砍参数 |
| 第二层 | 32B Q4_K_M（如 Qwen 32B，权重约 19.6GB） | 22-25GB（4K-8K ctx） | 能装下且有缓冲；更激进量化可推 16K+ |
| 第三层 | 70B Q4（约 37GB） | 装不下 | 必须 CPU 卸载，速度断崖，轻度对话可接受，主力工作流煎熬 |

速度参考（社区实测）：小模型（7B 级）可跑到 180 tok/s 量级；32B 量化模型速度明显低一档，**V100 的强项是"装得下"和长上下文稳定，不是极限 decode 速度**——decode 阶段 HBM2 的 900GB/s 带宽够用但比 GDDR6X 略逊，且架构老，Tensor Core 对 INT4 的加速效率不如新卡。

## 六、双卡 V100：显卡坞方案的真实面貌

双 V100 32G 显卡坞（总 64GB 显存）是社区里"万元搞定大模型"的代表方案：

- 可运行 gpt-oss 20B、Qwen 32B 等模型，双卡 32B 量化 + 长上下文体验完整
- **但注意**：双卡间走 PCIe 互连，张量并行（TP）的 AllReduce 通信开销会吃掉部分收益——**单卡装得下就单卡跑**，双卡的价值在"一张卡装不下"的 60B-70B 档（PP 流水线并行比 TP 在 PCIe 上更高效）
- 功耗和散热要按两张 250W 算，风道方案翻倍做

## 七、结论

**V100 32G 适合谁**：预算有限但要 32GB 容量跑 32B 量化模型 + 长上下文、接受老架构的速度上限、愿意自己改散热。不适合谁：追求极限 decode 速度、不想折腾驱动和散热、需要 BF16/FP8 新精度。

验卡（Mats + 24h 烤机）→ 散热整备（双 12cm 风道 + 竖装）→ 535 驱动 → Q4 量化模型优先，是这个卡型的标准路径。


---
来源：https://laobanclaw.top/articles/gpu-v100-32g-local-llm-full-guide/（AI 军火库）
