KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

3
篇文章
4
内容板块

FEATURED · 精选文章

部署教程

RTX 5090 拉满 Strata 125B:decode 149 tok/s、prefill 6004 tok/s 与 1M 上下文的完整配置

5090 32GB 是 Strata 的完全体:decode 125-149 tok/s、prefill 6004 tok/s、MTP 接受率 76%、1M 上下文 YaRN 能跑。三个加速开关:prefill auto:32768 让 prefill 快 21-35%、conversation-cache 让追问快 10-20 倍、kv-resident 追问免重算。附跨版本 stager 回归坑和 200K+ prefill 阻塞调度的注意事项。

阅读全文

LATEST ARTICLES · 其余文章

028GB 和 11GB 老显卡跑 125B:5500 XT 15 tok/s,2080 Ti 跑满 262K 完整窗口2019 年的 RX 5500 XT 8GB 能到 15-17 tok/s,Tesla P4 8GB 22 tok/s,RTX 2080 Ti 11GB 更狠——显存压满 10.5G 靠 KV streaming 跑满 262,144 token 完整窗口,decode 34 tok/s,250K 深度追问 3.56 秒出结果。三组小显存锚点数据 + MTP 在老卡上开还是关的完整判断标准。03Strata 双卡 layer split 让 125B decode 翻倍:16+16 显存实测 54-61 tok/s,NVLink 没用,第三张卡是负优化Strata 双卡的价值不是算力叠加而是容量叠加:两张 16GB 卡的专家缓存合计覆盖 98% 路由专家,把 GPU+CPU 混跑变成纯 GPU 跑。同 45W 功耗限制下 decode 从 30-37 提到 54-61 tok/s 接近翻倍。附完整配置和三个反直觉结论:NVLink 零收益、第三张卡拖慢长 prompt、low-RAM 与 layer split 互斥需手编 json。