FEATURED · 精选文章
部署教程二手 RTX 3080 20G 魔改卡跑 27B:30+ t/s 的千元级方案
i5-5600 + 32G 内存 + 二手 3080 20G 魔改卡,跑 Qwen3.8-27B 稳定 30+ t/s、1200 t/s prefill,挂 DeepSeek Harness 当 coding agent。核心是 llama.cpp 按架构编译 + KV 量化,不是堆硬件。
KNOWLEDGE & PRACTICE
从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。
FEATURED · 精选文章
部署教程i5-5600 + 32G 内存 + 二手 3080 20G 魔改卡,跑 Qwen3.8-27B 稳定 30+ t/s、1200 t/s prefill,挂 DeepSeek Harness 当 coding agent。核心是 llama.cpp 按架构编译 + KV 量化,不是堆硬件。
LATEST ARTICLES · 其余文章
14M5 Max 128GB 跑 Flash-Next:128K 全项 PASSMac Studio M5 Max 128GB 跑 Qwen3.8 Flash-Next 128K 上下文:prefill 1900 t/s、decode 49 t/s,retrieval / tool call 全项 PASS。15一个 Chat Template 救活 KV 缓存MTP 下 Qwen3.6-27B 稳定 50+ t/s,但聊几句就刷缓存不命中、重算几十秒到几分钟。换成 Qwen-Fixed-Chat-Templates 后,聊一小时缓存失效只剩个位数次。16W9700 装进老平台:BIOS 四连改X99 + W9700 跑通前,BIOS 有四个设置必须改对,其中一个改错就花屏进不去系统。Above 4G、纯 UEFI、关 Secure Boot、PCIe 锁 Gen3,外加一个千万别碰的 Re-Size BAR。17双卡 5070 Ti 跑 125B MoE:最高 140 t/s双卡 RTX 5070 Ti 16G + Threadripper + Strata 跑 125B MoE(IQ3_XXS):prefill 3200 t/s,decode 最高 140 t/s,256K 全程可用。18DSH 上下文裁剪:不需要大模型DeepSeek API 断网那天,本地模型顶上但上下文超限,云端压缩用不了。解法:不需要压缩,直接裁剪——不靠大模型,纯脚本成对剪掉最旧对话。19搬一个 WMMA Kernel,Strata Prefill 翻近一倍Strata 刚支持 7900XTX 时 prefill 才 700 多,把 vLLM 上的专用 WMMA kernel 搬过来,prefill 直接干到 1300+。思路简单但收益巨大。20单卡 R9700 二次开发 SGLang:MXFP4 原生内核单卡 R9700 32G 二次开发 SGLang,Qwen3.8 27B 从 AWQ 改造成 MXFP4 原生内核:PP 2000 / TG 90 t/s,上下文 229K。买的是用上 RDNA4 的 FP4 硬件。21JEV-Ultrafast:桌面 Agent 提速 10 倍同一个 computer-use 任务,改前 271 秒改后 27 秒,差 9.9 倍。核心是读结构化 DOM(46ms)而不是看截图,决策简化成一次 TypeSafe Choice。22NInfer:70+ t/s 的速度代价是显存NInfer 主打速度极致:单卡 3090 跑 27B 稳定 70+ t/s,远超 llama.cpp。代价是显存占用激进——上下文拉长或多并发时显存就是墙。23llama.cpp 官方支持 DFlash2 投机解码不用魔改、不用双卡、不用 SGLang——llama.cpp 官方版本直接支持 DFlash2 投机解码,单卡 7900XTX 开箱即用。轻量 Draft 模型猜 4-7 个 token,主模型批量验证。24M5 Ultra 256GB:1.2TB/s 带宽意味着什么M5 Ultra 256GB 统一内存、1.2TB/s 带宽,跑 MoE 的 prefill 预计比 M3 Ultra 快 3-4 倍。统一内存带宽是本地推理核心指标,MoE 每层 expert 搬运速度直接翻倍。25Strata 125B MoE 全档位实测与 Prefill 调优单卡 7900XTX + 64G DDR3 跑 125B MoE,prefill 峰值 1602 t/s,256K 仍有 1258 t/s。hipBLASLt 调优让 prefill 743→1179 t/s(+58.7%),回退率 55%→0%。全程 ROCm。