RX 7900 XTX 是 AMD 消费级阵营里跑大模型的主力卡:24GB GDDR6、960GB/s 显存带宽、RDNA3 架构,价格约为 RTX 4090 的一半。这篇整理它在本地 LLM 推理上的完整实测画像:能跑多大的模型、Ollama/ROCm 怎么调、以及 A 卡阵营特有的几个坑(HSA_OVERRIDE_GFX_VERSION、Vulkan 后端、显存占用比 N 卡更吃紧)。
一、24GB 能装多大:量化精度阶梯
| 量化精度 | 显存占用系数 | 7900 XTX (24GB) 最大支持参数 | 生成速度 (tok/s) | 精度损失 |
|---|---|---|---|---|
| FP16 | 2.0 B/param | ~10B-12B | 15-20 | 无 |
| INT8 | 1.0 B/param | ~20B-24B | 25-35 | 极小 |
| INT4 (Q4_K_M) | 0.7 B/param | ~60B-70B | 40-55 | 轻微 |
结论与 N 卡 24GB 档一致:INT4 是 24GB 卡的核心玩法。70B 的 Q4_K_M 量化版(约 22GB)能完整装下,留约 2GB 给上下文窗口。FP16 只适合 12B 以内——日常对话、代码辅助、文档总结用 INT4 的"智力下降"几乎不可感知,换来的是模型规模翻倍。
二、两个 A 卡特有的反直觉点(社区反复验证)
1. 24GB 显存 ≠ 长上下文自由
实测案例:7900 XTX 跑 7B 模型,反而比 16GB 的 4080 更早爆显存。原因是 ROCm 栈的默认配置下,KV Cache 和中间激活的显存占用比 CUDA 栈明显更大。同样"模型装得下",A 卡留给上下文的余量更少。
对策:长上下文场景要主动砍 ctx 长度,或降一档量化精度(Q5_K_M → Q4_K_M),把显存预算让给 KV Cache。
2. Vulkan 后端可能比 ROCm 还快
有用户在 Windows 环境实测:本以为 AMD 跑大模型必须靠 HIP/ROCm,结果 Vulkan 后端反而快得离谱。AMD 软件栈还在快速迭代期,不同后端(ROCm/HIP、Vulkan、DirectML)的实际表现随驱动版本波动大。免费的速度提升:在你自己的卡上把各后端各试一遍,用同一模型同一 prompt 对比 tokens/s,选最快的那个。
三、环境搭建:ROCm 的必查项
# RDNA3 卡识别异常时(报 gfx 版本不对、fallback 到 CPU),强制指定 GFX 版本
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve
# 实时监控:温度/功耗/显存,显存过热会降频直接吃掉 tokens/s
watch -n 1 rocm-smi两个常见症状与对应处理:
ollama serve启动后rocm-smi看不到卡 / 模型跑在 CPU 上 → 90% 是 GFX 版本没对上,加HSA_OVERRIDE_GFX_VERSION- 显存占用异常高、上下文一长就 OOM → ROCm 默认 KV Cache 策略更吃显存,主动限制 num_ctx
四、调参:Ollama 与 LM Studio 的关键参数
Ollama(Linux 环境)
Modelfile 里两个参数是速度关键:
FROM llama3:70b-instruct-q4_K_M
PARAMETER num_ctx 8192
PARAMETER num_batch 512num_ctx:决定能"记住"多长的对话历史。默认值偏小,长文档处理会频繁重置上下文num_batch:影响并行处理能力。7900 XTX 上 512~1024 是吞吐比甜点——过大会显存溢出,过小吃不满 GPU
LM Studio(图形化)
- GPU Offload 滑块务必拉满(所有层卸载到 GPU)。只部分卸载时,CPU↔GPU 数据拷贝成为巨大瓶颈,速度可能从 40 tok/s 骤降到 5 tok/s
- Context Length 在显存允许前提下尽量开大;生成中突然变慢或报错,大概率显存爆了,减小 ctx 或降一档量化
五、散热、超频与稳定性
7900 XTX 发热量不小,长时间满载推理默认频率下温度 75-80°C。实测教训:
- 小幅超频(核心 +100MHz、显存 +200MHz)速度提升约 8%,但温度逼近 85°C 阈值,且跑 70B 超过 30 分钟后出现概率性推理错误(乱码/中断)
- 降压超频(undervolt)比提频更值:压低电压曲线降约 5°C 且不损失性能,长时间稳定性显著提升
- 风道不佳的机箱加一把直吹背板风扇——显存过热降频直接影响 tokens/s
rocm-smi常开监控,温度过高立即调整
六、定位结论
- 性价比:不到 RTX 4090 一半的价格,提供约 75% 的推理性能(24GB 档),覆盖 7B-70B 主流开源模型,是消费级 A 卡跑大模型的主力选择
- 对比 N 卡 24GB 档(3090/4090):单请求速度差距不大(显存带宽 960 vs 936 GB/s 同档),但 A 卡的长上下文余量更紧、软件栈成熟度更低;N 卡生态省心,A 卡价格更低
- 下一步升级路径:需要 32GB 容量时,AMD 阵营对应的是 R9700(RDNA4,32GB),见本站 R9700 专文
一句话:7900 XTX 跑大模型 = INT4 量化优先 + num_batch 512~1024 + 降压超频 + 长上下文主动砍 ctx;后端不迷信 ROCm,各后端实测选最快的。