# 8GB 和 11GB 老显卡跑 125B：5500 XT 15 tok/s，2080 Ti 跑满 262K 完整窗口

> 2019 年的 RX 5500 XT 8GB 能到 15-17 tok/s，Tesla P4 8GB 22 tok/s，RTX 2080 Ti 11GB 更狠——显存压满 10.5G 靠 KV streaming 跑满 262,144 token 完整窗口，decode 34 tok/s，250K 深度追问 3.56 秒出结果。三组小显存锚点数据 + MTP 在老卡上开还是关的完整判断标准。

![8GB 和 11GB 老显卡跑 125B 大模型](/assets/articles/lcz/strata-old-gpu-8gb-11gb/hero.jpg)

> 2019 年的 RX 5500 XT（8GB）和 RTX 2080 Ti（11GB），到 2026 年还能跑 125B 的 MoE 大模型吗？Strata 的长尾支持给出了肯定的答案：8GB 的卡能到 15-22 tok/s，11GB 的卡甚至能跑满 262K 的完整上下文窗口。这篇文章把小显存、老架构卡的实测数据、配置和"能跑但别期待太高"的真实边界讲清楚。

## 为什么老卡也能跑：Strata 的长尾支持逻辑

Strata 把模型权重按量化分片，专家池放内存和 SSD，GPU 只负责最热门的专家缓存。这个设计意味着：**显卡的显存决定命中率，但不决定能不能跑**——8GB 显存装不下全部专家，但装得下"够用的那一小部分"，剩下走内存。

更关键的是它对老架构的源码构建路径支持：Turing（sm_75）、Ampere（sm_86）、甚至 Volta/Pascal 时代的计算卡，都有对应的实验性 CUDA/HIP 构建路径。

## 实测数据：小显存端的三组锚点

**RTX 2080 Ti 11GB（Turing sm_75，Threadripper 3960X）——最亮眼的**

这是 Strata 社区最极端的案例：**11GB 的卡跑满 262,144 token 的完整上下文窗口**。

| 场景 | prefill | decode |
|---|---|---|
| 128K 冷 prompt | 566 tok/s（226.6 秒填完） | 34.1 tok/s |
| 250K 深度 follow-up | 只读 470 个新 token（3.56 秒） | 34.6 tok/s |

关键细节：
- **VRAM 用满 10,525 / 11,264 MiB，恒定**——显存压满，靠 KV streaming 撑住长上下文
- 引擎 RSS 52.3-52.9 GiB（内存是主力），decode 专家缓存命中率 50-57%
- 图像走 CPU encoder，每张 768×512 约 1.6 秒
- 250K 深度追问时几乎不用重读（KV 复用），3.56 秒就出结果

**证明：11GB 显存 + 大内存 + KV 流式，能跑满 125B 的完整窗口**，代价是 prefill 慢（128K 要 4 分钟）。

**RX 5500 XT 8GB（RDNA1 gfx1012，2019 年）——长尾支持的代表**

走手动 Linux HIP 源码构建路径，Ryzen 5 3600 + 56GB DDR4：

| 任务 | 输出 | MTP off | MTP on |
|---|---|---|---|
| counting | 512 | 11.35 tok/s | **16.81 tok/s** |
| coding | 125 | 10.45 tok/s | **15.30 tok/s** |
| writing | 232 | 10.17 tok/s | 10.91 tok/s |

坑：**MTP 加速了 decode，但增加了 prefill 时间**——对 8K 的新请求，总完成时长反而变长了。8GB 卡上开不开 MTP 要按场景判断：长对话 follow-up 开，大量新请求关。

**Tesla P4 8GB（Pascal sm_61，计算卡）——最低门槛**

CUDA 12.x 实验性支持，bounded FP32 prefill 路径，IQ3_S + Q8 KV：

- **MTP 生成：22.09 tok/s（counting）/ 20.24（coding）/ 14.94（writing）**
- 同样有 MTP prefill 开销吃掉总时长的问题

## 老卡/小卡跑 125B 的真实边界

| 显卡 | 显存 | decode | 能跑满 262K 窗口 | 备注 |
|---|---|---|---|---|
| RX 5500 XT | 8GB | 10-17 tok/s | 否（8K 上下文） | 手动 HIP 构建，MTP 按需开 |
| Tesla P4 | 8GB | 15-22 tok/s | 否（8K 上下文） | 计算卡，FP32 prefill |
| RTX 2080 Ti | 11GB | 34 tok/s | **是（满窗口）** | KV streaming，显存压满 |
| RTX 3500 Ada | 12GB | 9-10 tok/s | 否 | 消费级内存带宽限制 |

**规律：显存越大、内存越多、KV 流式打开，老卡越接近"实用"。** 8GB 卡是"能跑起来看看"，11GB + 大内存 + KV streaming 是能跑满窗口的真·可用。

## 三个实用建议

1. **别只看显存，内存带宽是隐藏瓶颈。** 2080 Ti 能跑满窗口，一半功劳在 Threadripper 的大内存带宽。8GB 卡配 56GB 内存和配 32GB 内存，速度差一大截。
2. **老架构要走源码构建，别用预编译包。** 5500 XT 是手动 Linux HIP 路径，Turing/Ampere 老卡也常有专门的实验性构建，README 里的预编译包不一定覆盖。
3. **MTP 按场景开关。** 老卡/小卡上 MTP 的 prefill 开销占比更高，长对话 follow-up 值得开，大量独立新请求反而拖累总时长。

## 数据出处

本文数据来自 Strata 官方仓库（github.com/Niko1221/Strata）社区 benchmark issue：2080 Ti 11GB 满窗口实测 #469、5500 XT 8GB HIP 构建 #323、Tesla P4 8GB 实验支持 #336、3500 Ada 12GB #6。


---
来源：https://laobanclaw.top/articles/strata-old-gpu-8gb-11gb/（AI 军火库）
