# Strata 125B MoE 全档位实测与 Prefill 调优

> 单卡 7900XTX + 64G DDR3 跑 125B MoE，prefill 峰值 1602 t/s，256K 仍有 1258 t/s。hipBLASLt 调优让 prefill 743→1179 t/s（+58.7%），回退率 55%→0%。全程 ROCm。

![Strata 引擎与 RDNA3 优化示意](/assets/articles/lcz/strata/hero.jpg)

> 单卡 7900XTX + 64GB DDR3，跑 125B MoE 模型，prefill 峰值 1602 tok/s，256K 超长 prompt 仍有 1258 tok/s。全程 ROCm/HIP，不是 NVIDIA。

## 配置

| 项目 | 规格 |
| --- | --- |
| GPU | AMD RX 7900 XTX 24GB（RDNA3 / gfx1100） |
| 后端 | ROCm 10.0，HIP 本地编译 |
| CPU | Xeon E5-2678 v3（12 核 24 线程，无 AVX-512） |
| 内存 | 64GB DDR3（X99 D3 主板） |
| 模型 | Qwen3.8-Flash-Next 125B MoE / IQ3_XXS 量化 |
| 引擎 | Strata 0.1.27（local-hip，gfx1100） |

## 实测数据

| 上下文 | Prefill | Decode |
| --- | --- | --- |
| 1K | 1602 t/s | ~84 t/s |
| 16K | ~1400 t/s | ~84 t/s |
| 32K | ~1250 t/s | 48-64 t/s |
| 256K | 1258 t/s | ~50 t/s |

读满 26 万 token 的超长 prompt 约 3.5 分钟。

## hipBLASLt Prefill 调优：+58.7%

Strata 默认的 hipBLASLt 配置在长上下文下会触发大量回退（fallback 到非最优 kernel），实测回退率高达 55.1%。

针对性调优后：
- Prefill 从 743 t/s → 1179 t/s（**+58.7%**）
- 回退率从 55.1% → 0%

核心是调整 hipBLASLt 的 kernel 选择策略，让长上下文的矩阵乘法走最优路径而不是频繁回退。

## 一个值得注意的现象

这个引擎的专家基本都在 RAM 缓存，支持 CPU/GPU 混合计算，所以会看到**短上下文的 prefill 比长上下文的还低**——主要是 VRAM caching 构建过程中的摩擦成本。换句话说：**模型越用越快**，因为专家权重在 RAM 里热起来了。

## 适合谁

- 单卡 24G 显存，想跑 100B+ MoE 模型
- 用 ROCm 而不是 CUDA 的人
- 能接受"自己编译 + 调优"折腾成本的人


---
来源：https://laobanclaw.top/articles/strata-rdna3-prefill-tune/（AI 军火库）
