KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

51
篇文章
4
内容板块

LATEST ARTICLES · 其余文章

26Strata 125B MoE 全档位实测与 Prefill 调优单卡 7900XTX + 64G DDR3 跑 125B MoE,prefill 峰值 1602 t/s,256K 仍有 1258 t/s。hipBLASLt 调优让 prefill 743→1179 t/s(+58.7%),回退率 55%→0%。全程 ROCm。27老平台双卡 P2P 的解法:PCIe Switch两块 9700 想跑 P2P 但主板不支持——老平台双卡最头疼的问题。一张 PCIe Switch 卡 + 台达 1500W,让显卡间数据走 Switch 直接转发,绕过 CPU 中转。28双卡 SGLang 多并发:TTFT < 1s双卡 TP 跑多并发,90% 情况首 token 延迟 <1s,80K 上下文 80-100 t/s,比 llama.cpp 和 vLLM 都丝滑。核心是把 VLLM kernel port 到 SGLang 支持 gfx1100。2924G 显卡跑 512K 上下文:KVMem 内存分页24G 显存跑 512K 上下文,不是显存变多,是 KVMem 把'全部历史驻留显存'改了——GPU 只留有限工作集,大的放 Host RAM。单卡 64K→512K decode 全程不衰减。30Resizable BAR 让老平台速度翻 3 倍X99 + 7900XTX 在 Windows 下跑 27B 只有 12 t/s、首 token 卡 4 分钟。根因是主板默认把显卡锁死在 256MB Small BAR。注入 ReBarDxe 后 decode 12→37 t/s,+195%。31TurboQuant:显存减半,速度翻倍同样的 24G 显卡跑同一模型,TurboQuant 比传统 Q4 多塞约 2 倍上下文,速度反而更快——省显存的同时省带宽。7900XTX 实测 256K prefill 970 t/s。32我用一张 32G 的 AMD 显卡跑本地大模型:风扇、功耗、量化全部调到位后的最终答案一张 32GB 显存的 AMD 工作站卡(R9700)+ 普通主机跑本地大模型:逐路停转实测风扇映射、锁 250W 降温 8°C 且更安静、量化对撞证明瓶颈不在带宽、前缀缓存 32 倍加速,外加一张"别再折腾"负面清单——所有数字都是反复实测的终版答案。33NInfer 深度解析:专为单张 5090 而生的 C++/CUDA 推理引擎NInfer 是从头用 C++/CUDA 写的单 GPU 推理引擎,定位明确——榨干单张 RTX 5090 上的 Qwen 系列推理(Qwen3.6/3.8,文/图/视频)。本文对比它与 vLLM/SGLang 通用引擎的根本区别,拆解"单卡+单模型"为何能榨出性能,给出选型建议、与 Strata 的上下游关系与踩坑记录。34Strata 实测:一张消费级显卡 + 64G 内存,怎么把 125B 大模型跑通125B MoE 模型(24576 个专家)正常得几百 GB 显存才跑得动,Strata 把它落到一张 12-24GB N 卡 + 64GB 内存的普通主机上,一键安装,写出答案 60-95 tok/s、读 prompt 2000+ tok/s。本文整理官方 README 一手实测表、量化档位 vs 内存需求、整机分摊原理、双卡/AMD/长上下文进阶玩法与踩坑记录。352026 主流 LLM 推理引擎选型:vLLM / SGLang / LMDeploy / KTransformers / TensorRT-LLM 到底怎么选没有最快的推理引擎,只有最适合你场景的引擎。本文拆解 5 大主流推理引擎的核心技术(PagedAttention、RadixAttention、TurboMind 双引擎、CPU 极致优化、NVIDIA 内核融合),整理社区实测吞吐 / 延迟 / 显存数据,给出选型决策树与 6 个踩坑记录,帮你把"选引擎"这笔账算明白。36L40S 24GB:数据中心卡下放家用,跑大模型实测与选型L40S 与 4090 同代架构、同显存,但无游戏限制、ECC 可选、PCIe 满速。本文整理规格对比、社区实测、买 L40S 的决策框架与买前必知。37Tesla P40 24GB 性价比之王:实测数据与买前必知的坑2016 年上市的数据中心卡,2026 年二手 ¥1500 上下,"每 GB 显存成本"几乎无人能敌。本文整理 P40 性能底细、双卡跑 70B 可行性、买前必知的坑与决策框架。