
双卡 RTX 5070 Ti 16G + Threadripper Pro + Strata,跑 125B MoE(IQ3_XXS):prefill 3200 tok/s,decode 最高 140 tok/s——256K 上下文全程可用。
配置
| 项目 | 规格 |
|---|---|
| GPU | 双卡 RTX 5070 Ti 16G |
| 模型 | Swift-Qwen3.8-Flash-Next IQ3_XXS |
| 引擎 | Strata v0.1.31 |
| KV cache | INT8 |
| Context | 256K |
| CPU | AMD Threadripper Pro 3945WX(12C/24T) |
| RAM | DDR4-2400 ECC 八通道(153 GB/s) |
| PCIe | 双 PCIe 4.0 x16 |
实测数据(按任务类型)
| 任务 | Decode 速度 |
|---|---|
| 解题 | 127 tok/s |
| Coding(tool call) | 110~140 tok/s |
| 英文写作 | 100 tok/s |
| 中文写作 | 85 tok/s |
Prefill:3200 tok/s(双卡聚合)。
Coding 场景下 tool call 持续 139.6~140.1 tok/s 输出,连续几十秒不掉速——这个稳定性才是双卡部署的真正价值。
为什么 16G 双卡能跑 125B MoE
MoE 模型的激活参数量远小于总参数量。125B 的 Flash-Next 每层只激活一小部分专家,单卡 16G 放不下全部权重,但双卡 32G + Strata 的 CPU/GPU 混合调度(专家权重放 RAM 缓存)就够了。
适合谁
- 预算买不起 5090/7900XTX,但两张 5070 Ti 能买得起
- 需要 256K 上下文跑 MoE 模型做 coding agent
- 对 prefill 速度有要求(3200 tok/s 意味着 256K prompt 约 80 秒读完)