KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

4
篇文章
4
内容板块

FEATURED · 精选文章

部署教程

12GB 显卡跑 125B 大模型:真实速度 9-40 tok/s,hugepages 和 PCIe 校准两个坑一次讲完

Strata 把 125B 的门槛定在 12GB 起步:3500 Ada 12GB 实测 decode 9-10 tok/s 是'能用级',但加内存、跑 calibrate、配 hugepages 三步做完速度明显提升。两个坑:nr_hugepages 给小了系统静默退化成 4K 页不报错,PCIe 启动探测读数漂移 3 倍必须手动校准。附 12GB 完整配置和选型建议。

阅读全文

LATEST ARTICLES · 其余文章

02RTX 5090 拉满 Strata 125B:decode 149 tok/s、prefill 6004 tok/s 与 1M 上下文的完整配置5090 32GB 是 Strata 的完全体:decode 125-149 tok/s、prefill 6004 tok/s、MTP 接受率 76%、1M 上下文 YaRN 能跑。三个加速开关:prefill auto:32768 让 prefill 快 21-35%、conversation-cache 让追问快 10-20 倍、kv-resident 追问免重算。附跨版本 stager 回归坑和 200K+ prefill 阻塞调度的注意事项。038GB 和 11GB 老显卡跑 125B:5500 XT 15 tok/s,2080 Ti 跑满 262K 完整窗口2019 年的 RX 5500 XT 8GB 能到 15-17 tok/s,Tesla P4 8GB 22 tok/s,RTX 2080 Ti 11GB 更狠——显存压满 10.5G 靠 KV streaming 跑满 262,144 token 完整窗口,decode 34 tok/s,250K 深度追问 3.56 秒出结果。三组小显存锚点数据 + MTP 在老卡上开还是关的完整判断标准。04Strata 双卡 layer split 让 125B decode 翻倍:16+16 显存实测 54-61 tok/s,NVLink 没用,第三张卡是负优化Strata 双卡的价值不是算力叠加而是容量叠加:两张 16GB 卡的专家缓存合计覆盖 98% 路由专家,把 GPU+CPU 混跑变成纯 GPU 跑。同 45W 功耗限制下 decode 从 30-37 提到 54-61 tok/s 接近翻倍。附完整配置和三个反直觉结论:NVLink 零收益、第三张卡拖慢长 prompt、low-RAM 与 layer split 互斥需手编 json。