# 双卡 5070 Ti 跑 125B MoE：最高 140 t/s

> 双卡 RTX 5070 Ti 16G + Threadripper + Strata 跑 125B MoE（IQ3_XXS）：prefill 3200 t/s，decode 最高 140 t/s，256K 全程可用。

![双卡 5070 Ti 部署示意](/assets/articles/lcz/5070ti/hero.jpg)

> 双卡 RTX 5070 Ti 16G + Threadripper Pro + Strata，跑 125B MoE（IQ3_XXS）：prefill 3200 tok/s，decode 最高 140 tok/s——256K 上下文全程可用。

## 配置

| 项目 | 规格 |
| --- | --- |
| GPU | 双卡 RTX 5070 Ti 16G |
| 模型 | Swift-Qwen3.8-Flash-Next IQ3_XXS |
| 引擎 | Strata v0.1.31 |
| KV cache | INT8 |
| Context | 256K |
| CPU | AMD Threadripper Pro 3945WX（12C/24T） |
| RAM | DDR4-2400 ECC 八通道（153 GB/s） |
| PCIe | 双 PCIe 4.0 x16 |

## 实测数据（按任务类型）

| 任务 | Decode 速度 |
| --- | --- |
| 解题 | 127 tok/s |
| Coding（tool call） | 110~140 tok/s |
| 英文写作 | 100 tok/s |
| 中文写作 | 85 tok/s |

Prefill：**3200 tok/s**（双卡聚合）。

Coding 场景下 tool call 持续 139.6~140.1 tok/s 输出，连续几十秒不掉速——这个稳定性才是双卡部署的真正价值。

## 为什么 16G 双卡能跑 125B MoE

MoE 模型的激活参数量远小于总参数量。125B 的 Flash-Next 每层只激活一小部分专家，**单卡 16G 放不下全部权重，但双卡 32G + Strata 的 CPU/GPU 混合调度（专家权重放 RAM 缓存）就够了**。

## 适合谁

- 预算买不起 5090/7900XTX，但两张 5070 Ti 能买得起
- 需要 256K 上下文跑 MoE 模型做 coding agent
- 对 prefill 速度有要求（3200 tok/s 意味着 256K prompt 约 80 秒读完）


---
来源：https://laobanclaw.top/articles/5070ti-dual-strata-140tps/（AI 军火库）
