daniel-mtp HIP 分支构建流程示意

7900XTX 单卡 + daniel-mtp 的 HIP 分支 + MTP 投机解码,Qwen3.8-27B Q4_K_M 稳定 50+ t/s——这张"威猛但显存短"的卡,潜力还在被挖。

背景

AMD Radeon RX 7900 XTX 是一张很有特点的显卡:24GB 显存、960GB/s 显存带宽,运行安静,放到今天看性价比依然有优势。前后买了两张用了三个多月,陆续折腾了不少本地部署方案,这篇整理的是单卡 daniel-mtp 分支这一路。

性能来源:新的 HIP build

本次主要性能提升来自 daniel-mtp 的 llama.cpp 分支(基于 llama.cpp upstream + MTP PR #28243,HEAD 6fcaa16f4,2026-09-21),加上 AMD ROCm / HIP 社区针对 gfx1100 的持续优化。

MTP(Multi-Token Prediction)投机解码是核心:Qwen3.6/3.8 这类模型自带 draft head,能一次性预测多个 token,主模型验证后批量接受——把"逐字生成"变成"批量验证"。

测试环境

项目 配置
GPU AMD RX 7900 XTX 24GB(单卡)
CPU AMD Ryzen 5 9600X
主板 GIGABYTE B850 AI TOP
内存 64GB DDR5
PCIe 4.0 x8(双卡槽位下该槽为 x8,本篇单卡测试)
OS / ROCm Linux / ROCm 7.2.3
模型 Qwen3.8-27B Q4_K_M
参数 -ngl 99,-fa on,-b 2048,-ub 512,KV q8_0

128K Full-KV 已完整验证。

编译方向

gfx1100
GGML_NATIVE=ON
GGML_OPENMP=ON
CMAKE_HIP_FLAGS=-mllvm --amdgpu-unroll-threshold-local=600

这个 unroll threshold 是针对 gfx1100 的微调——本地展开阈值放宽后,kernel 在 RDNA3 的 wave 上调度更高效,是 MTP 分支收益的关键一环。

一句话

7900XTX 单卡的极限还没到顶:ROCm 社区对 gfx1100 的优化还在持续,MTP + 新 HIP build 的组合是目前 27B 单卡最稳的方案之一。