strata-flashnext/hero.jpg" alt="Strata 引擎跑 Flash-Next 速度跃升曲线示意">

两周前还在"29 t/s prefill 能用就行",两周后 Strata 直接把 Flash-Next 干到 1270 t/s——"学得慢,就不用学了",速度真的赶不上新技术冒出来的速度。

两周的路线演进(同一张 7900XTX)

路线 引擎 量化 / 模型 结果
1 llama.cpp + Vulkan GSQ-RCO Q2_0 Prefill ~29.3,Decode ~13.2 t/s
2 MoE4All / infr UD-Q2_K_XL Prefill ~248.9,Decode 16.57 t/s
3 llama.cpp + Vulkan IQ4_XS Prefill 150.8,Decode 17.88 t/s;长期服务约 8–14
4 MoE4All / infr 0.8/0.9 AD-4.27bpw Q4_K_M-M64 131K:Prefill 672,Decode 32.2–35.3
5 Strata 0.1.27 + HIP Orca / IQ3_XXS Prefill 841–1271,Decode 50.9–59.2,254K 仍 841.5 / 52.1

从第 1 条到第 5 条,Prefill 涨了 43 倍。

硬件环境

项目 配置
GPU RX 7900 XTX 24GB(单卡)
CPU Ryzen 5 9600X
内存 64GB DDR5
系统 Ubuntu 24.04.4 / ROCm 7.2.3
模型 Qwen3.8 Flash-Next(超大 MoE)

值得注意的点

  1. 三套引擎对比不是严格 apples-to-apples:llama.cpp、MoE4All、Strata 用的量化不同,绝对数字不能直接比,但量级差异是真实的。
  2. 254K 上下文 prefill 不衰减:254K 下仍 841.5 t/s / 52.1 t/s,这对 MoE 引擎来说很少见。
  3. 补充更新(10 月 1 日):Strata 升级 + RDNA3 WMMA 后,Prefill 再提升约 18%。

一句话

"能用就行"到"快得怀疑人生"只隔了两周。对单卡跑超大 MoE 的人,Strata + ROCm 是目前 7900XTX 上最值得追的路线。