strata-old-gpu-8gb-11gb/hero.jpg" alt="8GB 和 11GB 老显卡跑 125B 大模型">
2019 年的 RX 5500 XT(8GB)和 RTX 2080 Ti(11GB),到 2026 年还能跑 125B 的 MoE 大模型吗?Strata 的长尾支持给出了肯定的答案:8GB 的卡能到 15-22 tok/s,11GB 的卡甚至能跑满 262K 的完整上下文窗口。这篇文章把小显存、老架构卡的实测数据、配置和"能跑但别期待太高"的真实边界讲清楚。
为什么老卡也能跑:Strata 的长尾支持逻辑
Strata 把模型权重按量化分片,专家池放内存和 SSD,GPU 只负责最热门的专家缓存。这个设计意味着:显卡的显存决定命中率,但不决定能不能跑——8GB 显存装不下全部专家,但装得下"够用的那一小部分",剩下走内存。
更关键的是它对老架构的源码构建路径支持:Turing(sm_75)、Ampere(sm_86)、甚至 Volta/Pascal 时代的计算卡,都有对应的实验性 CUDA/HIP 构建路径。
实测数据:小显存端的三组锚点
RTX 2080 Ti 11GB(Turing sm_75,Threadripper 3960X)——最亮眼的
这是 Strata 社区最极端的案例:11GB 的卡跑满 262,144 token 的完整上下文窗口。
| 场景 | prefill | decode |
|---|---|---|
| 128K 冷 prompt | 566 tok/s(226.6 秒填完) | 34.1 tok/s |
| 250K 深度 follow-up | 只读 470 个新 token(3.56 秒) | 34.6 tok/s |
关键细节:
- VRAM 用满 10,525 / 11,264 MiB,恒定——显存压满,靠 KV streaming 撑住长上下文
- 引擎 RSS 52.3-52.9 GiB(内存是主力),decode 专家缓存命中率 50-57%
- 图像走 CPU encoder,每张 768×512 约 1.6 秒
- 250K 深度追问时几乎不用重读(KV 复用),3.56 秒就出结果
证明:11GB 显存 + 大内存 + KV 流式,能跑满 125B 的完整窗口,代价是 prefill 慢(128K 要 4 分钟)。
RX 5500 XT 8GB(RDNA1 gfx1012,2019 年)——长尾支持的代表
走手动 Linux HIP 源码构建路径,Ryzen 5 3600 + 56GB DDR4:
| 任务 | 输出 | MTP off | MTP on |
|---|---|---|---|
| counting | 512 | 11.35 tok/s | 16.81 tok/s |
| coding | 125 | 10.45 tok/s | 15.30 tok/s |
| writing | 232 | 10.17 tok/s | 10.91 tok/s |
坑:MTP 加速了 decode,但增加了 prefill 时间——对 8K 的新请求,总完成时长反而变长了。8GB 卡上开不开 MTP 要按场景判断:长对话 follow-up 开,大量新请求关。
Tesla P4 8GB(Pascal sm_61,计算卡)——最低门槛
CUDA 12.x 实验性支持,bounded FP32 prefill 路径,IQ3_S + Q8 KV:
- MTP 生成:22.09 tok/s(counting)/ 20.24(coding)/ 14.94(writing)
- 同样有 MTP prefill 开销吃掉总时长的问题
老卡/小卡跑 125B 的真实边界
| 显卡 | 显存 | decode | 能跑满 262K 窗口 | 备注 |
|---|---|---|---|---|
| RX 5500 XT | 8GB | 10-17 tok/s | 否(8K 上下文) | 手动 HIP 构建,MTP 按需开 |
| Tesla P4 | 8GB | 15-22 tok/s | 否(8K 上下文) | 计算卡,FP32 prefill |
| RTX 2080 Ti | 11GB | 34 tok/s | 是(满窗口) | KV streaming,显存压满 |
| RTX 3500 Ada | 12GB | 9-10 tok/s | 否 | 消费级内存带宽限制 |
规律:显存越大、内存越多、KV 流式打开,老卡越接近"实用"。 8GB 卡是"能跑起来看看",11GB + 大内存 + KV streaming 是能跑满窗口的真·可用。
三个实用建议
- 别只看显存,内存带宽是隐藏瓶颈。 2080 Ti 能跑满窗口,一半功劳在 Threadripper 的大内存带宽。8GB 卡配 56GB 内存和配 32GB 内存,速度差一大截。
- 老架构要走源码构建,别用预编译包。 5500 XT 是手动 Linux HIP 路径,Turing/Ampere 老卡也常有专门的实验性构建,README 里的预编译包不一定覆盖。
- MTP 按场景开关。 老卡/小卡上 MTP 的 prefill 开销占比更高,长对话 follow-up 值得开,大量独立新请求反而拖累总时长。
数据出处
本文数据来自 Strata 官方仓库(github.com/Niko1221/Strata)社区 benchmark issue:2080 Ti 11GB 满窗口实测 #469、5500 XT 8GB HIP 构建 #323、Tesla P4 8GB 实验支持 #336、3500 Ada 12GB #6。