
7900XTX 单卡 + daniel-mtp 的 HIP 分支 + MTP 投机解码,Qwen3.8-27B Q4_K_M 稳定 50+ t/s——这张"威猛但显存短"的卡,潜力还在被挖。
背景
AMD Radeon RX 7900 XTX 是一张很有特点的显卡:24GB 显存、960GB/s 显存带宽,运行安静,放到今天看性价比依然有优势。前后买了两张用了三个多月,陆续折腾了不少本地部署方案,这篇整理的是单卡 daniel-mtp 分支这一路。
性能来源:新的 HIP build
本次主要性能提升来自 daniel-mtp 的 llama.cpp 分支(基于 llama.cpp upstream + MTP PR #28243,HEAD 6fcaa16f4,2026-09-21),加上 AMD ROCm / HIP 社区针对 gfx1100 的持续优化。
MTP(Multi-Token Prediction)投机解码是核心:Qwen3.6/3.8 这类模型自带 draft head,能一次性预测多个 token,主模型验证后批量接受——把"逐字生成"变成"批量验证"。
测试环境
| 项目 | 配置 |
|---|---|
| GPU | AMD RX 7900 XTX 24GB(单卡) |
| CPU | AMD Ryzen 5 9600X |
| 主板 | GIGABYTE B850 AI TOP |
| 内存 | 64GB DDR5 |
| PCIe | 4.0 x8(双卡槽位下该槽为 x8,本篇单卡测试) |
| OS / ROCm | Linux / ROCm 7.2.3 |
| 模型 | Qwen3.8-27B Q4_K_M |
| 参数 | -ngl 99,-fa on,-b 2048,-ub 512,KV q8_0 |
128K Full-KV 已完整验证。
编译方向
gfx1100
GGML_NATIVE=ON
GGML_OPENMP=ON
CMAKE_HIP_FLAGS=-mllvm --amdgpu-unroll-threshold-local=600这个 unroll threshold 是针对 gfx1100 的微调——本地展开阈值放宽后,kernel 在 RDNA3 的 wave 上调度更高效,是 MTP 分支收益的关键一环。
一句话
7900XTX 单卡的极限还没到顶:ROCm 社区对 gfx1100 的优化还在持续,MTP + 新 HIP build 的组合是目前 27B 单卡最稳的方案之一。