# 24GB 显存甜点区：RTX 3090 / 7900 XTX / 4090 本地大模型实测与选卡

> 同样 24GB 显存，N 卡与 A 卡跑大模型的真实差距只有 10-14%——本文用公开实测数据讲透 24GB 能装多大模型、3090 与 4090 的速度差、7900 XTX 的量化阶梯，以及超频、PCIe 插槽、ROCm 环境三个最常踩的坑，给出按预算的选卡结论。

同样 24GB 显存，RTX 3090 和 AMD RX 7900 XTX 是本地大模型部署里最常被讨论的两张消费级卡。这篇把它们和 RTX 4090 放在一起，用公开实测数据说清楚：24GB 这个容量到底能装下多大的模型，N 卡和 A 卡在推理速度上的真实差距有多大，以及各自踩过的坑。

## 一、先记住一个结论：显存容量 > 算力，24GB 是消费级的甜点

本地跑大模型，第一约束不是 TFLOPS，是**模型权重装不装得下**。一个 7B 模型 FP16 加载光权重就要约 14GB，加上 KV Cache 和运行时开销，16GB 的卡上下文稍微拉长就 OOM。

量化是绕不开的一步。GGUF Q4_K_M 量化后的大致占用：7B 约 4.2GB，14B 约 8.5GB，32B 约 20GB，70B 约 37GB。对照下来：

| 模型规模 | Q4_K_M 量化后 | 16GB 卡 | 24GB 卡 | 32GB 卡 |
|---|---|---|---|---|
| 7B/8B | ~4.5GB | 舒适，可拉大上下文 | 轻松 | 轻松 |
| 14B | ~8.5GB | 可用 | 舒适 | 舒适 |
| 32B | ~20GB | 装不下 | 紧但能跑 | 舒适，还有余量 |
| 70B | ~37GB | 不可能 | 仅 INT4 极限 + offload | offload 勉强跑通 |

**32GB 能轻松装下 32B Q4 还留长上下文空间；24GB 卡在"32B 能跑但没余量"的位置**——这就是 24GB 卡的核心定位：中小模型的全能选手，大模型的极限选手。

## 二、N 卡侧：3090 和 4090 的实测差距没有纸面参数那么大

公开实测（Ollama，Qwen3，8 组复杂度相近的 prompt，MAX_TOKENS=256）：

| 指标 | 3090 | 4090 | 4090/3090 |
|---|---|---|---|
| 显存 | 24GB GDDR6X | 24GB GDDR6X | 相同 |
| 显存带宽 | 936 GB/s | 1008 GB/s | 1.08x |
| TDP | 350W | 450W | 1.29x |
| qwen3:8b FP16 生成速度 | 47.46 tok/s | 52.45 tok/s | 1.10x |
| qwen3:14b Q4_K_M 生成速度 | 67.62 tok/s | 77.31 tok/s | 1.14x |
| 8b 平均响应时长 | 5.39s | 4.88s | 快 9% |

两张卡的显存容量相同、带宽差距只有 8%，所以**推理速度差距只有 10%~14%，远小于纸面算力 2.3 倍的差距**——LLM 生成阶段（decode）是显存带宽瓶颈，不是算力瓶颈。3090 二手价格通常只有 4090 的一半左右，**单卡跑 24GB 档模型，3090 的性价比普遍更高**；4090 的优势在训练/微调（算力优势开始体现）和更长的驱动支持周期。

另一份单卡 vLLM 实测参考：3090 跑 Qwen 9B 可稳定到 75 tok/s 级别；跑 7B 模型 8192 tokens 长文本生成没有压力。

## 三、A 卡侧：7900 XTX 的量化阶梯与两个反直觉点

RX 7900 XTX（24GB GDDR6，RDNA3，显存带宽 960 GB/s）的公开极限测试数据：

| 量化精度 | 24GB 可承载参数 | 生成速度 | 精度损失 |
|---|---|---|---|
| FP16 | ~10B-12B | 15-20 tok/s | 无 |
| INT8 | ~20B-24B | 25-35 tok/s | 极小 |
| INT4 (Q4_K_M) | ~60B-70B | 40-55 tok/s | 轻微 |

两个反直觉点，都是社区实测反复验证过的：

1. **24GB 显存不等于长上下文自由**。有实测案例：7900 XTX 跑 7B 模型反而比 16GB 的 4080 更早爆显存——ROCm 栈的默认配置下 KV Cache 和中间激活的显存占用比 CUDA 栈明显更大。同样"装得下"，A 卡留给上下文的余量更少，**长上下文场景要主动砍 ctx 或降量化精度**。
2. **ROCm 不是唯一快路径**。有用户在 Windows 环境实测发现 Vulkan 后端跑 LLM 反而比 ROCm 快——AMD 的软件栈还在快速迭代期，**换后端可能是免费的速度提升，值得在自己卡上各试一遍**。

### ROCm 环境两个必查项

```bash
# 1. RDNA3/RDNA4 识别异常时，强制指定 GFX 版本（R9700 等 RDNA4 尤其注意）
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve

# 2. 用 rocm-smi 盯温度/功耗，显存过热会降频，直接吃掉 tokens/s
watch -n 1 rocm-smi
```

Ollama 调参侧：`num_ctx` 决定能记住多长的对话历史，`num_batch` 影响并行处理能力，24GB 卡上 **num_batch=512~1024 通常是吞吐比甜点**，过大会显存溢出，过小吃不满 GPU。

## 四、稳定性：超频的代价与降压超频的正确姿势

7900 XTX 默认频率下长时间推理温度 75-80°C。实测小幅超频（核心 +100MHz、显存 +200MHz）速度提升约 8%，但温度逼近 85°C 阈值，且跑 70B 大模型超过 30 分钟后出现概率性推理错误（输出乱码/中断）。**可复现的教训：对推理卡，降压超频（undervolt）比单纯提频更值**——压低电压曲线能降约 5°C 且不损失性能，长时间稳定性显著提升。

3090 侧的常见坑是**PCIe 插槽带宽**：3090 是 PCIe 4.0 卡，插在只支持 3.0 x4 的老槽上会带宽受限，表现为 GPU 利用率周期性波动。装卡前查主板插槽的实际协商速率。

## 五、选卡结论（按预算档）

- **预算最省、单卡跑 14B~32B**：二手 3090（约 4090 半价），N 卡生态最省心
- **预算最省、A 卡阵营**：二手 7900 XTX，INT4 下能摸到 70B，但接受 ROCm 栈的成熟度
- **要最新架构 + 长驱动支持**：4090，推理只比 3090 快 10-14%，但训练/微调优势明显
- **要 32GB 容量**：这三张都到不了，看 V100 32G 或 AMD R9700（本站另有专文）


---
来源：https://laobanclaw.top/articles/gpu-24gb-sweet-spot-3090-7900xtx-4090/（AI 军火库）
