KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

12
篇文章
4
内容板块

LATEST ARTICLES · 其余文章

027900XTX 跑 Flash-Next:两周 Prefill 涨 43 倍同一张 7900XTX,两周前 29 t/s prefill '能用就行',两周后 Strata 直接干到 1270 t/s。从第 1 条路线到第 5 条,prefill 涨 43 倍,254K 上下文不衰减。037900XTX 的 daniel-mtp HIP 新分支7900XTX 单卡 + daniel-mtp 的 HIP 分支 + MTP 投机解码,Qwen3.8-27B Q4_K_M 稳定 50+ t/s。gfx1100 的 unroll threshold 微调是收益关键一环。0427B Q5_K_M 一次写完打飞机游戏7900XTX + Qwen3.8 27B Q5_K_M + DSH,实测让模型从零写完整 2D 打飞机游戏(单 HTML 文件):5409 token 代码平均 89 t/s 一气呵成。05一个 Chat Template 救活 KV 缓存MTP 下 Qwen3.6-27B 稳定 50+ t/s,但聊几句就刷缓存不命中、重算几十秒到几分钟。换成 Qwen-Fixed-Chat-Templates 后,聊一小时缓存失效只剩个位数次。06搬一个 WMMA Kernel,Strata Prefill 翻近一倍Strata 刚支持 7900XTX 时 prefill 才 700 多,把 vLLM 上的专用 WMMA kernel 搬过来,prefill 直接干到 1300+。思路简单但收益巨大。07llama.cpp 官方支持 DFlash2 投机解码不用魔改、不用双卡、不用 SGLang——llama.cpp 官方版本直接支持 DFlash2 投机解码,单卡 7900XTX 开箱即用。轻量 Draft 模型猜 4-7 个 token,主模型批量验证。08Strata 125B MoE 全档位实测与 Prefill 调优单卡 7900XTX + 64G DDR3 跑 125B MoE,prefill 峰值 1602 t/s,256K 仍有 1258 t/s。hipBLASLt 调优让 prefill 743→1179 t/s(+58.7%),回退率 55%→0%。全程 ROCm。09双卡 SGLang 多并发:TTFT < 1s双卡 TP 跑多并发,90% 情况首 token 延迟 <1s,80K 上下文 80-100 t/s,比 llama.cpp 和 vLLM 都丝滑。核心是把 VLLM kernel port 到 SGLang 支持 gfx1100。1024G 显卡跑 512K 上下文:KVMem 内存分页24G 显存跑 512K 上下文,不是显存变多,是 KVMem 把'全部历史驻留显存'改了——GPU 只留有限工作集,大的放 Host RAM。单卡 64K→512K decode 全程不衰减。11Resizable BAR 让老平台速度翻 3 倍X99 + 7900XTX 在 Windows 下跑 27B 只有 12 t/s、首 token 卡 4 分钟。根因是主板默认把显卡锁死在 256MB Small BAR。注入 ReBarDxe 后 decode 12→37 t/s,+195%。12TurboQuant:显存减半,速度翻倍同样的 24G 显卡跑同一模型,TurboQuant 比传统 Q4 多塞约 2 倍上下文,速度反而更快——省显存的同时省带宽。7900XTX 实测 256K prefill 970 t/s。