strata/hero.jpg" alt="Strata 引擎与 RDNA3 优化示意">
单卡 7900XTX + 64GB DDR3,跑 125B MoE 模型,prefill 峰值 1602 tok/s,256K 超长 prompt 仍有 1258 tok/s。全程 ROCm/HIP,不是 NVIDIA。
配置
| 项目 | 规格 |
|---|---|
| GPU | AMD RX 7900 XTX 24GB(RDNA3 / gfx1100) |
| 后端 | ROCm 10.0,HIP 本地编译 |
| CPU | Xeon E5-2678 v3(12 核 24 线程,无 AVX-512) |
| 内存 | 64GB DDR3(X99 D3 主板) |
| 模型 | Qwen3.8-Flash-Next 125B MoE / IQ3_XXS 量化 |
| 引擎 | Strata 0.1.27(local-hip,gfx1100) |
实测数据
| 上下文 | Prefill | Decode |
|---|---|---|
| 1K | 1602 t/s | ~84 t/s |
| 16K | ~1400 t/s | ~84 t/s |
| 32K | ~1250 t/s | 48-64 t/s |
| 256K | 1258 t/s | ~50 t/s |
读满 26 万 token 的超长 prompt 约 3.5 分钟。
hipBLASLt Prefill 调优:+58.7%
Strata 默认的 hipBLASLt 配置在长上下文下会触发大量回退(fallback 到非最优 kernel),实测回退率高达 55.1%。
针对性调优后:
- Prefill 从 743 t/s → 1179 t/s(+58.7%)
- 回退率从 55.1% → 0%
核心是调整 hipBLASLt 的 kernel 选择策略,让长上下文的矩阵乘法走最优路径而不是频繁回退。
一个值得注意的现象
这个引擎的专家基本都在 RAM 缓存,支持 CPU/GPU 混合计算,所以会看到短上下文的 prefill 比长上下文的还低——主要是 VRAM caching 构建过程中的摩擦成本。换句话说:模型越用越快,因为专家权重在 RAM 里热起来了。
适合谁
- 单卡 24G 显存,想跑 100B+ MoE 模型
- 用 ROCm 而不是 CUDA 的人
- 能接受"自己编译 + 调优"折腾成本的人