RX 7900 XTX 是 AMD 消费级阵营里跑大模型的主力卡:24GB GDDR6、960GB/s 显存带宽、RDNA3 架构,价格约为 RTX 4090 的一半。这篇整理它在本地 LLM 推理上的完整实测画像:能跑多大的模型、Ollama/ROCm 怎么调、以及 A 卡阵营特有的几个坑(HSA_OVERRIDE_GFX_VERSION、Vulkan 后端、显存占用比 N 卡更吃紧)。

一、24GB 能装多大:量化精度阶梯

量化精度 显存占用系数 7900 XTX (24GB) 最大支持参数 生成速度 (tok/s) 精度损失
FP16 2.0 B/param ~10B-12B 15-20 无
INT8 1.0 B/param ~20B-24B 25-35 极小
INT4 (Q4_K_M) 0.7 B/param ~60B-70B 40-55 轻微

结论与 N 卡 24GB 档一致:INT4 是 24GB 卡的核心玩法。70B 的 Q4_K_M 量化版(约 22GB)能完整装下,留约 2GB 给上下文窗口。FP16 只适合 12B 以内——日常对话、代码辅助、文档总结用 INT4 的"智力下降"几乎不可感知,换来的是模型规模翻倍。

二、两个 A 卡特有的反直觉点(社区反复验证)

1. 24GB 显存 ≠ 长上下文自由

实测案例:7900 XTX 跑 7B 模型,反而比 16GB 的 4080 更早爆显存。原因是 ROCm 栈的默认配置下,KV Cache 和中间激活的显存占用比 CUDA 栈明显更大。同样"模型装得下",A 卡留给上下文的余量更少。

对策:长上下文场景要主动砍 ctx 长度,或降一档量化精度(Q5_K_M → Q4_K_M),把显存预算让给 KV Cache。

2. Vulkan 后端可能比 ROCm 还快

有用户在 Windows 环境实测:本以为 AMD 跑大模型必须靠 HIP/ROCm,结果 Vulkan 后端反而快得离谱。AMD 软件栈还在快速迭代期,不同后端(ROCm/HIP、Vulkan、DirectML)的实际表现随驱动版本波动大。免费的速度提升:在你自己的卡上把各后端各试一遍,用同一模型同一 prompt 对比 tokens/s,选最快的那个。

三、环境搭建:ROCm 的必查项

# RDNA3 卡识别异常时(报 gfx 版本不对、fallback 到 CPU),强制指定 GFX 版本
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve

# 实时监控:温度/功耗/显存,显存过热会降频直接吃掉 tokens/s
watch -n 1 rocm-smi

两个常见症状与对应处理:

四、调参:Ollama 与 LM Studio 的关键参数

Ollama(Linux 环境)

Modelfile 里两个参数是速度关键:

FROM llama3:70b-instruct-q4_K_M
PARAMETER num_ctx 8192
PARAMETER num_batch 512

LM Studio(图形化)

五、散热、超频与稳定性

7900 XTX 发热量不小,长时间满载推理默认频率下温度 75-80°C。实测教训:

六、定位结论

一句话:7900 XTX 跑大模型 = INT4 量化优先 + num_batch 512~1024 + 降压超频 + 长上下文主动砍 ctx;后端不迷信 ROCm,各后端实测选最快的。