FEATURED · 精选文章
部署教程二手 RTX 3080 20G 魔改卡跑 27B:30+ t/s 的千元级方案
i5-5600 + 32G 内存 + 二手 3080 20G 魔改卡,跑 Qwen3.8-27B 稳定 30+ t/s、1200 t/s prefill,挂 DeepSeek Harness 当 coding agent。核心是 llama.cpp 按架构编译 + KV 量化,不是堆硬件。
KNOWLEDGE & PRACTICE
从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。
FEATURED · 精选文章
部署教程i5-5600 + 32G 内存 + 二手 3080 20G 魔改卡,跑 Qwen3.8-27B 稳定 30+ t/s、1200 t/s prefill,挂 DeepSeek Harness 当 coding agent。核心是 llama.cpp 按架构编译 + KV 量化,不是堆硬件。
LATEST ARTICLES · 其余文章
26老平台双卡 P2P 的解法:PCIe Switch两块 9700 想跑 P2P 但主板不支持——老平台双卡最头疼的问题。一张 PCIe Switch 卡 + 台达 1500W,让显卡间数据走 Switch 直接转发,绕过 CPU 中转。27双卡 SGLang 多并发:TTFT < 1s双卡 TP 跑多并发,90% 情况首 token 延迟 <1s,80K 上下文 80-100 t/s,比 llama.cpp 和 vLLM 都丝滑。核心是把 VLLM kernel port 到 SGLang 支持 gfx1100。2824G 显卡跑 512K 上下文:KVMem 内存分页24G 显存跑 512K 上下文,不是显存变多,是 KVMem 把'全部历史驻留显存'改了——GPU 只留有限工作集,大的放 Host RAM。单卡 64K→512K decode 全程不衰减。29Resizable BAR 让老平台速度翻 3 倍X99 + 7900XTX 在 Windows 下跑 27B 只有 12 t/s、首 token 卡 4 分钟。根因是主板默认把显卡锁死在 256MB Small BAR。注入 ReBarDxe 后 decode 12→37 t/s,+195%。30TurboQuant:显存减半,速度翻倍同样的 24G 显卡跑同一模型,TurboQuant 比传统 Q4 多塞约 2 倍上下文,速度反而更快——省显存的同时省带宽。7900XTX 实测 256K prefill 970 t/s。31我用一张 32G 的 AMD 显卡跑本地大模型:风扇、功耗、量化全部调到位后的最终答案一张 32GB 显存的 AMD 工作站卡(R9700)+ 普通主机跑本地大模型:逐路停转实测风扇映射、锁 250W 降温 8°C 且更安静、量化对撞证明瓶颈不在带宽、前缀缓存 32 倍加速,外加一张"别再折腾"负面清单——所有数字都是反复实测的终版答案。32NInfer 深度解析:专为单张 5090 而生的 C++/CUDA 推理引擎NInfer 是从头用 C++/CUDA 写的单 GPU 推理引擎,定位明确——榨干单张 RTX 5090 上的 Qwen 系列推理(Qwen3.6/3.8,文/图/视频)。本文对比它与 vLLM/SGLang 通用引擎的根本区别,拆解"单卡+单模型"为何能榨出性能,给出选型建议、与 Strata 的上下游关系与踩坑记录。33Strata 实测:一张消费级显卡 + 64G 内存,怎么把 125B 大模型跑通125B MoE 模型(24576 个专家)正常得几百 GB 显存才跑得动,Strata 把它落到一张 12-24GB N 卡 + 64GB 内存的普通主机上,一键安装,写出答案 60-95 tok/s、读 prompt 2000+ tok/s。本文整理官方 README 一手实测表、量化档位 vs 内存需求、整机分摊原理、双卡/AMD/长上下文进阶玩法与踩坑记录。342026 主流 LLM 推理引擎选型:vLLM / SGLang / LMDeploy / KTransformers / TensorRT-LLM 到底怎么选没有最快的推理引擎,只有最适合你场景的引擎。本文拆解 5 大主流推理引擎的核心技术(PagedAttention、RadixAttention、TurboMind 双引擎、CPU 极致优化、NVIDIA 内核融合),整理社区实测吞吐 / 延迟 / 显存数据,给出选型决策树与 6 个踩坑记录,帮你把"选引擎"这笔账算明白。35L40S 24GB:数据中心卡下放家用,跑大模型实测与选型L40S 与 4090 同代架构、同显存,但无游戏限制、ECC 可选、PCIe 满速。本文整理规格对比、社区实测、买 L40S 的决策框架与买前必知。36Tesla P40 24GB 性价比之王:实测数据与买前必知的坑2016 年上市的数据中心卡,2026 年二手 ¥1500 上下,"每 GB 显存成本"几乎无人能敌。本文整理 P40 性能底细、双卡跑 70B 可行性、买前必知的坑与决策框架。37RTX 5090 32GB FP16 推理:14B 全精度 vs 4090 量化的实测对比32GB 显存让 14B 模型从"勉强跑"变成"从容跑全精度"。本文整理 5090 与 4090 在 14B 全精度推理上的公开实测:显存账、速度差、坑位与升级决策框架。