KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

51
篇文章
4
内容板块

FEATURED · 精选文章

部署教程

12GB 显卡跑 125B 大模型:真实速度 9-40 tok/s,hugepages 和 PCIe 校准两个坑一次讲完

Strata 把 125B 的门槛定在 12GB 起步:3500 Ada 12GB 实测 decode 9-10 tok/s 是'能用级',但加内存、跑 calibrate、配 hugepages 三步做完速度明显提升。两个坑:nr_hugepages 给小了系统静默退化成 4K 页不报错,PCIe 启动探测读数漂移 3 倍必须手动校准。附 12GB 完整配置和选型建议。

阅读全文

LATEST ARTICLES · 其余文章

50RX 7900 XTX 跑大模型实测:量化阶梯、ROCm 调优与两个反直觉点24GB RDNA3 卡跑 LLM 的完整画像:FP16/INT8/INT4 三档量化能装多大模型、Ollama num_ctx 与 num_batch 调参、HSA_OVERRIDE_GFX_VERSION 兜底,以及 24GB 不等于长上下文自由、Vulkan 可能比 ROCm 更快两个反直觉点,附散热与降压超频建议。51R9700 32GB 本地推理定位:32B 全量 + 长上下文的甜点用法与调优要点RDNA4 架构 32GB 工作站的本地 AI 推理定位:32B Q4 全量 GPU + 8K-16K 上下文是最舒服用法,70B 只能 offload。本文整理 ROCm 部署路径、A 卡通用调优五要点,以及与 V100 32G / 5090 / L20 的 32GB 档对比和跨厂商多卡警告。