strata-flashnext/hero.jpg" alt="Strata 引擎跑 Flash-Next 速度跃升曲线示意">
两周前还在"29 t/s prefill 能用就行",两周后 Strata 直接把 Flash-Next 干到 1270 t/s——"学得慢,就不用学了",速度真的赶不上新技术冒出来的速度。
两周的路线演进(同一张 7900XTX)
| 路线 | 引擎 | 量化 / 模型 | 结果 |
|---|---|---|---|
| 1 | llama.cpp + Vulkan | GSQ-RCO Q2_0 | Prefill ~29.3,Decode ~13.2 t/s |
| 2 | MoE4All / infr | UD-Q2_K_XL | Prefill ~248.9,Decode 16.57 t/s |
| 3 | llama.cpp + Vulkan | IQ4_XS | Prefill 150.8,Decode 17.88 t/s;长期服务约 8–14 |
| 4 | MoE4All / infr 0.8/0.9 | AD-4.27bpw Q4_K_M-M64 | 131K:Prefill 672,Decode 32.2–35.3 |
| 5 | Strata 0.1.27 + HIP | Orca / IQ3_XXS | Prefill 841–1271,Decode 50.9–59.2,254K 仍 841.5 / 52.1 |
从第 1 条到第 5 条,Prefill 涨了 43 倍。
硬件环境
| 项目 | 配置 |
|---|---|
| GPU | RX 7900 XTX 24GB(单卡) |
| CPU | Ryzen 5 9600X |
| 内存 | 64GB DDR5 |
| 系统 | Ubuntu 24.04.4 / ROCm 7.2.3 |
| 模型 | Qwen3.8 Flash-Next(超大 MoE) |
值得注意的点
- 三套引擎对比不是严格 apples-to-apples:llama.cpp、MoE4All、Strata 用的量化不同,绝对数字不能直接比,但量级差异是真实的。
- 254K 上下文 prefill 不衰减:254K 下仍 841.5 t/s / 52.1 t/s,这对 MoE 引擎来说很少见。
- 补充更新(10 月 1 日):Strata 升级 + RDNA3 WMMA 后,Prefill 再提升约 18%。
一句话
"能用就行"到"快得怀疑人生"只隔了两周。对单卡跑超大 MoE 的人,Strata + ROCm 是目前 7900XTX 上最值得追的路线。