KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

56
篇文章
5
内容板块

LATEST ARTICLES · 其余文章

02PXA 洋垃圾老卡量化引擎:V100/P100 单卡 27B 代码 61 t/s、双卡 108 t/s 全表拆解PXA 是专攻 Pascal/Volta 的量化推理引擎:自研 PXQN 量化(29% 体积 97% 保真)+ 老卡专用 kernel + MTP 投机解码,单张 V100 跑 27B 代码 61.2 t/s、双卡 107.6 t/s、16GB 单卡 131K 上下文。本文把 PXQN 精度表、多卡速度表、v2026.10.1 修复数据全部拆开,附 R9700 实测横向对照。03R9700 多卡企业级部署方案:TP 链路验证 + vllm-radiance + 第三张卡为什么别买单卡 161 tok/s 之后的下一步:TP vs layer split 选型、卡间通信四步验证(ReBAR/ACS/showtopo)、引擎实测对比、锁功耗负面清单、双卡采购决策表04APXInf 端侧推理引擎:Rust 零依赖,机器人本体跑 VLA 提速 10.7 倍清华 + 无问芯穹 + 上交 9/15 开源:官方 README 全部硬数据拆解,PI-0.5 上 Jetson Thor/Orin,BF16/FP8/INT805小米 MiMo-V2.6-Pro 开源:1.02 万亿参数 MoE,开源榜第一 + 350 万美元账本420 亿激活 MoE 的算力账本、Artificial Analysis 开源榜第一的完整档案,含单源未交叉验证的争议标注062026 高性价比 AI 装机方向:从洋垃圾老平台到高端工作站整理社区几套不同预算的 AI 主机真实配置与用途:老平台洋垃圾、中端工作站、高端 Pro 卡,帮你按预算定方向。072026 消费级显卡跑大模型性能横评:从 3080 到 R9700 的真实 tok/s整理社区热帖的实测数据:各显卡跑 Qwen 系列 27B 的 tok/s 对照,帮你按预算选对卡。08双卡 / 多卡 TP 跑通 P2P 的完整实战:从 BIOS 到带宽实测R9700 等多卡张量并行的落地全记录:主板选型、BIOS 三件套、ACS 绕过、卡间带宽实测数据与常见坑。0912GB 显卡跑 125B 大模型:真实速度 9-40 tok/s,hugepages 和 PCIe 校准两个坑一次讲完Strata 把 125B 的门槛定在 12GB 起步:3500 Ada 12GB 实测 decode 9-10 tok/s 是'能用级',但加内存、跑 calibrate、配 hugepages 三步做完速度明显提升。两个坑:nr_hugepages 给小了系统静默退化成 4K 页不报错,PCIe 启动探测读数漂移 3 倍必须手动校准。附 12GB 完整配置和选型建议。10RTX 5090 拉满 Strata 125B:decode 149 tok/s、prefill 6004 tok/s 与 1M 上下文的完整配置5090 32GB 是 Strata 的完全体:decode 125-149 tok/s、prefill 6004 tok/s、MTP 接受率 76%、1M 上下文 YaRN 能跑。三个加速开关:prefill auto:32768 让 prefill 快 21-35%、conversation-cache 让追问快 10-20 倍、kv-resident 追问免重算。附跨版本 stager 回归坑和 200K+ prefill 阻塞调度的注意事项。118GB 和 11GB 老显卡跑 125B:5500 XT 15 tok/s,2080 Ti 跑满 262K 完整窗口2019 年的 RX 5500 XT 8GB 能到 15-17 tok/s,Tesla P4 8GB 22 tok/s,RTX 2080 Ti 11GB 更狠——显存压满 10.5G 靠 KV streaming 跑满 262,144 token 完整窗口,decode 34 tok/s,250K 深度追问 3.56 秒出结果。三组小显存锚点数据 + MTP 在老卡上开还是关的完整判断标准。12Strata 双卡 layer split 让 125B decode 翻倍:16+16 显存实测 54-61 tok/s,NVLink 没用,第三张卡是负优化Strata 双卡的价值不是算力叠加而是容量叠加:两张 16GB 卡的专家缓存合计覆盖 98% 路由专家,把 GPU+CPU 混跑变成纯 GPU 跑。同 45W 功耗限制下 decode 从 30-37 提到 54-61 tok/s 接近翻倍。附完整配置和三个反直觉结论:NVLink 零收益、第三张卡拖慢长 prompt、low-RAM 与 layer split 互斥需手编 json。13R9700 单卡跑 Qwen3.8-27B MXFP4:prefill 3300 tok/s 的完整配置与 4 个坑RDNA4 没有原生 MXFP4 运算单元,原生 ROCm vLLM 会退回 BF16 模拟反量化慢 3-5 倍。4 组 R9700 单卡实测:vllm-radiance 原生 kernel 下 prefill 2300-3300 tok/s、decode 峰值 161 tok/s、8 并发聚合 152。附三套方案(打包镜像/裸配/NVFP4)完整启动参数和显存、并发、ROCm 版本四个坑。