KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

56
篇文章
5
内容板块

LATEST ARTICLES · 其余文章

14二手 RTX 3080 20G 魔改卡跑 27B:30+ t/s 的千元级方案i5-5600 + 32G 内存 + 二手 3080 20G 魔改卡,跑 Qwen3.8-27B 稳定 30+ t/s、1200 t/s prefill,挂 DeepSeek Harness 当 coding agent。核心是 llama.cpp 按架构编译 + KV 量化,不是堆硬件。15把 7900XTX 当 7x24 本地 API 服务器7900XTX 的正确用法不是跑分,是当本地 API 服务器长期挂着,给 opencode / pi.dev 等编码 agent 当后端——代码不出家门、不限量、离线可用。质量追平云端,隐私自己掌握。16免费模型自己走全流程测试Hermes 官方免费 stealth/space-bunny-alpha,给 forkgram 改 bug 并让它自己走桌面 APP 全流程测试,一次走通。免费 Agent 模型把'让 AI 自己验证自己'的门槛降到零。177900XTX 跑 Flash-Next:两周 Prefill 涨 43 倍同一张 7900XTX,两周前 29 t/s prefill '能用就行',两周后 Strata 直接干到 1270 t/s。从第 1 条路线到第 5 条,prefill 涨 43 倍,254K 上下文不衰减。187900XTX 的 daniel-mtp HIP 新分支7900XTX 单卡 + daniel-mtp 的 HIP 分支 + MTP 投机解码,Qwen3.8-27B Q4_K_M 稳定 50+ t/s。gfx1100 的 unroll threshold 微调是收益关键一环。19DSH 系统监控悬浮卡DSH 里的 GPU 监控悬浮卡:数值时效与 nvitop 一致或更快,可随意拖拽、调整尺寸、悬浮不遮挡、一键隐藏。把 GPU 状态钉在 DSH 界面上,不切窗口。20GPU Console:多卡监控小窗桌面 GPU 监控小窗:多卡逐卡显示品牌色标 + 型号 + 温度/功耗/风扇/频率,30 秒利用率历史小图,无边框可拖拽、F11 全屏。MIT 开源一键安装包。215090 单卡 1M 上下文:YaRN + fp8 + 分层缓存单卡 RTX 5090 32G + SGLang 跑 Qwen3.6-35B NVFP4:YaRN 4.0 扩到 1M,KV cache fp8,分层缓存 24GB。出字快到'成篇文章吐出来',比云端 V4.1 还快。22M5 Max 128GB 跑 Flash-Next:128K 全项 PASSMac Studio M5 Max 128GB 跑 Qwen3.8 Flash-Next 128K 上下文:prefill 1900 t/s、decode 49 t/s,retrieval / tool call 全项 PASS。23一个 Chat Template 救活 KV 缓存MTP 下 Qwen3.6-27B 稳定 50+ t/s,但聊几句就刷缓存不命中、重算几十秒到几分钟。换成 Qwen-Fixed-Chat-Templates 后,聊一小时缓存失效只剩个位数次。24W9700 装进老平台:BIOS 四连改X99 + W9700 跑通前,BIOS 有四个设置必须改对,其中一个改错就花屏进不去系统。Above 4G、纯 UEFI、关 Secure Boot、PCIe 锁 Gen3,外加一个千万别碰的 Re-Size BAR。25双卡 5070 Ti 跑 125B MoE:最高 140 t/s双卡 RTX 5070 Ti 16G + Threadripper + Strata 跑 125B MoE(IQ3_XXS):prefill 3200 t/s,decode 最高 140 t/s,256K 全程可用。