# 7900XTX 的 daniel-mtp HIP 新分支

> 7900XTX 单卡 + daniel-mtp 的 HIP 分支 + MTP 投机解码，Qwen3.8-27B Q4_K_M 稳定 50+ t/s。gfx1100 的 unroll threshold 微调是收益关键一环。

![daniel-mtp HIP 分支构建流程示意](/assets/articles/lcz/daniel-mtp/hero.jpg)

> 7900XTX 单卡 + daniel-mtp 的 HIP 分支 + MTP 投机解码，Qwen3.8-27B Q4_K_M 稳定 50+ t/s——这张"威猛但显存短"的卡，潜力还在被挖。

## 背景

AMD Radeon RX 7900 XTX 是一张很有特点的显卡：24GB 显存、960GB/s 显存带宽，运行安静，放到今天看性价比依然有优势。前后买了两张用了三个多月，陆续折腾了不少本地部署方案，这篇整理的是**单卡 daniel-mtp 分支**这一路。

## 性能来源：新的 HIP build

本次主要性能提升来自 daniel-mtp 的 llama.cpp 分支（基于 llama.cpp upstream + MTP PR #28243，HEAD 6fcaa16f4，2026-09-21），加上 AMD ROCm / HIP 社区针对 gfx1100 的持续优化。

**MTP（Multi-Token Prediction）投机解码**是核心：Qwen3.6/3.8 这类模型自带 draft head，能一次性预测多个 token，主模型验证后批量接受——把"逐字生成"变成"批量验证"。

## 测试环境

| 项目 | 配置 |
| --- | --- |
| GPU | AMD RX 7900 XTX 24GB（单卡） |
| CPU | AMD Ryzen 5 9600X |
| 主板 | GIGABYTE B850 AI TOP |
| 内存 | 64GB DDR5 |
| PCIe | 4.0 x8（双卡槽位下该槽为 x8，本篇单卡测试） |
| OS / ROCm | Linux / ROCm 7.2.3 |
| 模型 | Qwen3.8-27B Q4_K_M |
| 参数 | -ngl 99，-fa on，-b 2048，-ub 512，KV q8_0 |

128K Full-KV 已完整验证。

## 编译方向

```
gfx1100
GGML_NATIVE=ON
GGML_OPENMP=ON
CMAKE_HIP_FLAGS=-mllvm --amdgpu-unroll-threshold-local=600
```

这个 unroll threshold 是针对 gfx1100 的微调——本地展开阈值放宽后，kernel 在 RDNA3 的 wave 上调度更高效，是 MTP 分支收益的关键一环。

## 一句话

7900XTX 单卡的极限还没到顶：ROCm 社区对 gfx1100 的优化还在持续，MTP + 新 HIP build 的组合是目前 27B 单卡最稳的方案之一。


---
来源：https://laobanclaw.top/articles/7900xtx-daniel-mtp-hip-build/（AI 军火库）
