FEATURED · 精选文章
部署教程R9700 多卡企业级部署方案:TP 链路验证 + vllm-radiance + 第三张卡为什么别买
单卡 161 tok/s 之后的下一步:TP vs layer split 选型、卡间通信四步验证(ReBAR/ACS/showtopo)、引擎实测对比、锁功耗负面清单、双卡采购决策表
KNOWLEDGE & PRACTICE
从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。
FEATURED · 精选文章
部署教程单卡 161 tok/s 之后的下一步:TP vs layer split 选型、卡间通信四步验证(ReBAR/ACS/showtopo)、引擎实测对比、锁功耗负面清单、双卡采购决策表
LATEST ARTICLES · 其余文章
62多卡 3090 大模型推理:TP / PP / TP+PP 并行策略实测与选卡决策4 张 3090 = 96GB 显存能装下 70B 量化模型还留长上下文。本文基于公开的 4 卡 vLLM 实测讲透三种并行方式的 GPU 利用率差异(TP 80-90% 胜出)、PCIe 互连下的通信开销,以及插槽带宽、供电散热、驱动掉卡、跨厂商混插五大坑,给出双卡/四卡的预算决策。63显存不够时怎么办:量化与 CPU offload 实战策略32GB 显存下跑 27B 模型的实用策略:量化精度取舍、offload 机制原理、层切分的真实效果与常见误区。64RX 7900 XTX 跑大模型实测:量化阶梯、ROCm 调优与两个反直觉点24GB RDNA3 卡跑 LLM 的完整画像:FP16/INT8/INT4 三档量化能装多大模型、Ollama num_ctx 与 num_batch 调参、HSA_OVERRIDE_GFX_VERSION 兜底,以及 24GB 不等于长上下文自由、Vulkan 可能比 ROCm 更快两个反直觉点,附散热与降压超频建议。65RAG 知识库实战:给本地商家搭一个能查能答的 AI 助理一个真实落地方向:把商家文档、产品资料做成 RAG 知识库,本地模型 + 向量检索,让 AI 基于自己的资料回答。66R9700 32GB 本地推理定位:32B 全量 + 长上下文的甜点用法与调优要点RDNA4 架构 32GB 工作站的本地 AI 推理定位:32B Q4 全量 GPU + 8K-16K 上下文是最舒服用法,70B 只能 offload。本文整理 ROCm 部署路径、A 卡通用调优五要点,以及与 V100 32G / 5090 / L20 的 32GB 档对比和跨厂商多卡警告。