# RX 7900 XTX 跑大模型实测：量化阶梯、ROCm 调优与两个反直觉点

> 24GB RDNA3 卡跑 LLM 的完整画像：FP16/INT8/INT4 三档量化能装多大模型、Ollama num_ctx 与 num_batch 调参、HSA_OVERRIDE_GFX_VERSION 兜底，以及 24GB 不等于长上下文自由、Vulkan 可能比 ROCm 更快两个反直觉点，附散热与降压超频建议。

RX 7900 XTX 是 AMD 消费级阵营里跑大模型的主力卡：24GB GDDR6、960GB/s 显存带宽、RDNA3 架构，价格约为 RTX 4090 的一半。这篇整理它在本地 LLM 推理上的完整实测画像：能跑多大的模型、Ollama/ROCm 怎么调、以及 A 卡阵营特有的几个坑（HSA_OVERRIDE_GFX_VERSION、Vulkan 后端、显存占用比 N 卡更吃紧）。

## 一、24GB 能装多大：量化精度阶梯

| 量化精度 | 显存占用系数 | 7900 XTX (24GB) 最大支持参数 | 生成速度 (tok/s) | 精度损失 |
|---|---|---|---|---|
| FP16 | 2.0 B/param | ~10B-12B | 15-20 | 无 |
| INT8 | 1.0 B/param | ~20B-24B | 25-35 | 极小 |
| INT4 (Q4_K_M) | 0.7 B/param | ~60B-70B | 40-55 | 轻微 |

结论与 N 卡 24GB 档一致：**INT4 是 24GB 卡的核心玩法**。70B 的 Q4_K_M 量化版（约 22GB）能完整装下，留约 2GB 给上下文窗口。FP16 只适合 12B 以内——日常对话、代码辅助、文档总结用 INT4 的"智力下降"几乎不可感知，换来的是模型规模翻倍。

## 二、两个 A 卡特有的反直觉点（社区反复验证）

### 1. 24GB 显存 ≠ 长上下文自由

实测案例：7900 XTX 跑 7B 模型，反而比 16GB 的 4080 更早爆显存。原因是 ROCm 栈的默认配置下，KV Cache 和中间激活的显存占用比 CUDA 栈明显更大。同样"模型装得下"，A 卡留给上下文的余量更少。

**对策**：长上下文场景要主动砍 ctx 长度，或降一档量化精度（Q5_K_M → Q4_K_M），把显存预算让给 KV Cache。

### 2. Vulkan 后端可能比 ROCm 还快

有用户在 Windows 环境实测：本以为 AMD 跑大模型必须靠 HIP/ROCm，结果 Vulkan 后端反而快得离谱。AMD 软件栈还在快速迭代期，不同后端（ROCm/HIP、Vulkan、DirectML）的实际表现随驱动版本波动大。**免费的速度提升：在你自己的卡上把各后端各试一遍**，用同一模型同一 prompt 对比 tokens/s，选最快的那个。

## 三、环境搭建：ROCm 的必查项

```bash
# RDNA3 卡识别异常时（报 gfx 版本不对、fallback 到 CPU），强制指定 GFX 版本
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve

# 实时监控：温度/功耗/显存，显存过热会降频直接吃掉 tokens/s
watch -n 1 rocm-smi
```

两个常见症状与对应处理：
- `ollama serve` 启动后 `rocm-smi` 看不到卡 / 模型跑在 CPU 上 → 90% 是 GFX 版本没对上，加 `HSA_OVERRIDE_GFX_VERSION`
- 显存占用异常高、上下文一长就 OOM → ROCm 默认 KV Cache 策略更吃显存，主动限制 num_ctx

## 四、调参：Ollama 与 LM Studio 的关键参数

### Ollama（Linux 环境）

Modelfile 里两个参数是速度关键：

```dockerfile
FROM llama3:70b-instruct-q4_K_M
PARAMETER num_ctx 8192
PARAMETER num_batch 512
```

- `num_ctx`：决定能"记住"多长的对话历史。默认值偏小，长文档处理会频繁重置上下文
- `num_batch`：影响并行处理能力。**7900 XTX 上 512~1024 是吞吐比甜点**——过大会显存溢出，过小吃不满 GPU

### LM Studio（图形化）

- **GPU Offload 滑块务必拉满**（所有层卸载到 GPU）。只部分卸载时，CPU↔GPU 数据拷贝成为巨大瓶颈，速度可能从 40 tok/s 骤降到 5 tok/s
- **Context Length 在显存允许前提下尽量开大**；生成中突然变慢或报错，大概率显存爆了，减小 ctx 或降一档量化

## 五、散热、超频与稳定性

7900 XTX 发热量不小，长时间满载推理默认频率下温度 75-80°C。实测教训：

- 小幅超频（核心 +100MHz、显存 +200MHz）速度提升约 8%，但温度逼近 85°C 阈值，且跑 70B 超过 30 分钟后出现概率性推理错误（乱码/中断）
- **降压超频（undervolt）比提频更值**：压低电压曲线降约 5°C 且不损失性能，长时间稳定性显著提升
- 风道不佳的机箱加一把直吹背板风扇——显存过热降频直接影响 tokens/s
- `rocm-smi` 常开监控，温度过高立即调整

## 六、定位结论

- **性价比**：不到 RTX 4090 一半的价格，提供约 75% 的推理性能（24GB 档），覆盖 7B-70B 主流开源模型，是消费级 A 卡跑大模型的主力选择
- **对比 N 卡 24GB 档**（3090/4090）：单请求速度差距不大（显存带宽 960 vs 936 GB/s 同档），但 A 卡的长上下文余量更紧、软件栈成熟度更低；N 卡生态省心，A 卡价格更低
- **下一步升级路径**：需要 32GB 容量时，AMD 阵营对应的是 R9700（RDNA4，32GB），见本站 R9700 专文

**一句话：7900 XTX 跑大模型 = INT4 量化优先 + num_batch 512~1024 + 降压超频 + 长上下文主动砍 ctx；后端不迷信 ROCm，各后端实测选最快的。**


---
来源：https://laobanclaw.top/articles/gpu-7900xtx-rocm-llm-realworld/（AI 军火库）
