strata/hero.jpg" alt="Strata 引擎与 RDNA3 优化示意">

单卡 7900XTX + 64GB DDR3,跑 125B MoE 模型,prefill 峰值 1602 tok/s,256K 超长 prompt 仍有 1258 tok/s。全程 ROCm/HIP,不是 NVIDIA。

配置

项目 规格
GPU AMD RX 7900 XTX 24GB(RDNA3 / gfx1100)
后端 ROCm 10.0,HIP 本地编译
CPU Xeon E5-2678 v3(12 核 24 线程,无 AVX-512)
内存 64GB DDR3(X99 D3 主板)
模型 Qwen3.8-Flash-Next 125B MoE / IQ3_XXS 量化
引擎 Strata 0.1.27(local-hip,gfx1100)

实测数据

上下文 Prefill Decode
1K 1602 t/s ~84 t/s
16K ~1400 t/s ~84 t/s
32K ~1250 t/s 48-64 t/s
256K 1258 t/s ~50 t/s

读满 26 万 token 的超长 prompt 约 3.5 分钟。

hipBLASLt Prefill 调优:+58.7%

Strata 默认的 hipBLASLt 配置在长上下文下会触发大量回退(fallback 到非最优 kernel),实测回退率高达 55.1%。

针对性调优后:

核心是调整 hipBLASLt 的 kernel 选择策略,让长上下文的矩阵乘法走最优路径而不是频繁回退。

一个值得注意的现象

这个引擎的专家基本都在 RAM 缓存,支持 CPU/GPU 混合计算,所以会看到短上下文的 prefill 比长上下文的还低——主要是 VRAM caching 构建过程中的摩擦成本。换句话说:模型越用越快,因为专家权重在 RAM 里热起来了。

适合谁