# 7900XTX 跑 Flash-Next：两周 Prefill 涨 43 倍

> 同一张 7900XTX，两周前 29 t/s prefill '能用就行'，两周后 Strata 直接干到 1270 t/s。从第 1 条路线到第 5 条，prefill 涨 43 倍，254K 上下文不衰减。

![Strata 引擎跑 Flash-Next 速度跃升曲线示意](/assets/articles/lcz/strata-flashnext/hero.jpg)

> 两周前还在"29 t/s prefill 能用就行"，两周后 Strata 直接把 Flash-Next 干到 1270 t/s——"学得慢，就不用学了"，速度真的赶不上新技术冒出来的速度。

## 两周的路线演进（同一张 7900XTX）

| 路线 | 引擎 | 量化 / 模型 | 结果 |
| --- | --- | --- | --- |
| 1 | llama.cpp + Vulkan | GSQ-RCO Q2_0 | Prefill ~29.3，Decode ~13.2 t/s |
| 2 | MoE4All / infr | UD-Q2_K_XL | Prefill ~248.9，Decode 16.57 t/s |
| 3 | llama.cpp + Vulkan | IQ4_XS | Prefill 150.8，Decode 17.88 t/s；长期服务约 8–14 |
| 4 | MoE4All / infr 0.8/0.9 | AD-4.27bpw Q4_K_M-M64 | 131K：Prefill 672，Decode 32.2–35.3 |
| 5 | **Strata 0.1.27 + HIP** | Orca / IQ3_XXS | **Prefill 841–1271，Decode 50.9–59.2**，254K 仍 841.5 / 52.1 |

从第 1 条到第 5 条，**Prefill 涨了 43 倍**。

## 硬件环境

| 项目 | 配置 |
| --- | --- |
| GPU | RX 7900 XTX 24GB（单卡） |
| CPU | Ryzen 5 9600X |
| 内存 | 64GB DDR5 |
| 系统 | Ubuntu 24.04.4 / ROCm 7.2.3 |
| 模型 | Qwen3.8 Flash-Next（超大 MoE） |

## 值得注意的点

1. **三套引擎对比不是严格 apples-to-apples**：llama.cpp、MoE4All、Strata 用的量化不同，绝对数字不能直接比，但量级差异是真实的。
2. **254K 上下文 prefill 不衰减**：254K 下仍 841.5 t/s / 52.1 t/s，这对 MoE 引擎来说很少见。
3. **补充更新（10 月 1 日）**：Strata 升级 + RDNA3 WMMA 后，Prefill 再提升约 18%。

## 一句话

"能用就行"到"快得怀疑人生"只隔了两周。对单卡跑超大 MoE 的人，Strata + ROCm 是目前 7900XTX 上最值得追的路线。


---
来源：https://laobanclaw.top/articles/7900xtx-strata-flashnext-1270pps/（AI 军火库）
