双卡 5070 Ti 部署示意

双卡 RTX 5070 Ti 16G + Threadripper Pro + Strata,跑 125B MoE(IQ3_XXS):prefill 3200 tok/s,decode 最高 140 tok/s——256K 上下文全程可用。

配置

项目 规格
GPU 双卡 RTX 5070 Ti 16G
模型 Swift-Qwen3.8-Flash-Next IQ3_XXS
引擎 Strata v0.1.31
KV cache INT8
Context 256K
CPU AMD Threadripper Pro 3945WX(12C/24T)
RAM DDR4-2400 ECC 八通道(153 GB/s)
PCIe 双 PCIe 4.0 x16

实测数据(按任务类型)

任务 Decode 速度
解题 127 tok/s
Coding(tool call) 110~140 tok/s
英文写作 100 tok/s
中文写作 85 tok/s

Prefill:3200 tok/s(双卡聚合)。

Coding 场景下 tool call 持续 139.6~140.1 tok/s 输出,连续几十秒不掉速——这个稳定性才是双卡部署的真正价值。

为什么 16G 双卡能跑 125B MoE

MoE 模型的激活参数量远小于总参数量。125B 的 Flash-Next 每层只激活一小部分专家,单卡 16G 放不下全部权重,但双卡 32G + Strata 的 CPU/GPU 混合调度(专家权重放 RAM 缓存)就够了。

适合谁