KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

56
篇文章
5
内容板块

LATEST ARTICLES · 其余文章

26DSH 上下文裁剪:不需要大模型DeepSeek API 断网那天,本地模型顶上但上下文超限,云端压缩用不了。解法:不需要压缩,直接裁剪——不靠大模型,纯脚本成对剪掉最旧对话。27搬一个 WMMA Kernel,Strata Prefill 翻近一倍Strata 刚支持 7900XTX 时 prefill 才 700 多,把 vLLM 上的专用 WMMA kernel 搬过来,prefill 直接干到 1300+。思路简单但收益巨大。28单卡 R9700 二次开发 SGLang:MXFP4 原生内核单卡 R9700 32G 二次开发 SGLang,Qwen3.8 27B 从 AWQ 改造成 MXFP4 原生内核:PP 2000 / TG 90 t/s,上下文 229K。买的是用上 RDNA4 的 FP4 硬件。29NInfer:70+ t/s 的速度代价是显存NInfer 主打速度极致:单卡 3090 跑 27B 稳定 70+ t/s,远超 llama.cpp。代价是显存占用激进——上下文拉长或多并发时显存就是墙。30llama.cpp 官方支持 DFlash2 投机解码不用魔改、不用双卡、不用 SGLang——llama.cpp 官方版本直接支持 DFlash2 投机解码,单卡 7900XTX 开箱即用。轻量 Draft 模型猜 4-7 个 token,主模型批量验证。31M5 Ultra 256GB:1.2TB/s 带宽意味着什么M5 Ultra 256GB 统一内存、1.2TB/s 带宽,跑 MoE 的 prefill 预计比 M3 Ultra 快 3-4 倍。统一内存带宽是本地推理核心指标,MoE 每层 expert 搬运速度直接翻倍。32Strata 125B MoE 全档位实测与 Prefill 调优单卡 7900XTX + 64G DDR3 跑 125B MoE,prefill 峰值 1602 t/s,256K 仍有 1258 t/s。hipBLASLt 调优让 prefill 743→1179 t/s(+58.7%),回退率 55%→0%。全程 ROCm。33老平台双卡 P2P 的解法:PCIe Switch两块 9700 想跑 P2P 但主板不支持——老平台双卡最头疼的问题。一张 PCIe Switch 卡 + 台达 1500W,让显卡间数据走 Switch 直接转发,绕过 CPU 中转。34双卡 SGLang 多并发:TTFT < 1s双卡 TP 跑多并发,90% 情况首 token 延迟 <1s,80K 上下文 80-100 t/s,比 llama.cpp 和 vLLM 都丝滑。核心是把 VLLM kernel port 到 SGLang 支持 gfx1100。3524G 显卡跑 512K 上下文:KVMem 内存分页24G 显存跑 512K 上下文,不是显存变多,是 KVMem 把'全部历史驻留显存'改了——GPU 只留有限工作集,大的放 Host RAM。单卡 64K→512K decode 全程不衰减。36Resizable BAR 让老平台速度翻 3 倍X99 + 7900XTX 在 Windows 下跑 27B 只有 12 t/s、首 token 卡 4 分钟。根因是主板默认把显卡锁死在 256MB Small BAR。注入 ReBarDxe 后 decode 12→37 t/s,+195%。37TurboQuant:显存减半,速度翻倍同样的 24G 显卡跑同一模型,TurboQuant 比传统 Q4 多塞约 2 倍上下文,速度反而更快——省显存的同时省带宽。7900XTX 实测 256K prefill 970 t/s。