KNOWLEDGE & PRACTICE

文章

从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。

51
篇文章
4
内容板块

LATEST ARTICLES · 其余文章

382026 开源旗舰五强横评:Qwen3.6 / DeepSeek V4 / GLM-5.1 谁能跑起来2026 年 4 月五款开源旗舰同场竞技。本文按"消费级硬件能不能跑"为主线,整理参数、架构、跑分、显存需求、许可协议,给出决策清单。39RTX 5090 32GB FP16 推理:14B 全精度 vs 4090 量化的实测对比32GB 显存让 14B 模型从"勉强跑"变成"从容跑全精度"。本文整理 5090 与 4090 在 14B 全精度推理上的公开实测:显存账、速度差、坑位与升级决策框架。40AMD 显卡本地部署大模型完全指南(ROCm 实战)基于你的 AMD 显卡,从零完成大模型本地部署的实战指南:ROCm 环境搭建、Ollama 与 vLLM 两种方案、27B 量化模型实测速度与显存占用,以及驱动、镜像、量化三大常见坑。41本地大模型实战对比:DeepSeek / Qwen / Llama 怎么选三款主流开源模型在本地场景下的定位差异、开源协议与选型建议,帮你在 32GB 显存下选对模型。4224GB 显存甜点区:RTX 3090 / 7900 XTX / 4090 本地大模型实测与选卡同样 24GB 显存,N 卡与 A 卡跑大模型的真实差距只有 10-14%——本文用公开实测数据讲透 24GB 能装多大模型、3090 与 4090 的速度差、7900 XTX 的量化阶梯,以及超频、PCIe 插槽、ROCm 环境三个最常踩的坑,给出按预算的选卡结论。43RTX 2080 Ti 22G 魔改卡实测:22GB 显存怎么来的、能跑什么、三件必须想清的风险2019 年的 Turing 卡把 11GB 显存换成 2GB 芯片堆到 22GB,约 1900 元拿到接近专业卡的容量。本文整理魔改原理、SDXL/SVD/大模型公开实测、Mats 验卡流程,以及无保修虚焊、矿卡来源、架构天花板三件买前必看的风险。44Ollama + ROCm:AMD 显卡从零跑通本地大模型AMD 显卡用户跑本地模型的完整路径:ROCm 环境准备、ollama-for-amd 部署、模型运行验证与常见坑,附 R9700 实测。45V100 32G 本地大模型部署与调优全指南:验卡、散热、驱动到调优32GB 显存档里价格最低的方案:Volta 架构、HBM2 900GB/s、250W 单 8pin。本文记录完整链路——Mats 验卡 + 24 小时烤机、双 12cm 风道散热整备、Windows 535 专业驱动、32GB 三层承载范围,以及双卡显卡坞方案的真实面貌。46推理成本一年跌了十倍:对本地部署意味着什么大模型 API 价格战白热化,推理成本一年降 10~100 倍。云便宜了,本地部署还有没有价值?算清楚这笔账。47多卡 3090 大模型推理:TP / PP / TP+PP 并行策略实测与选卡决策4 张 3090 = 96GB 显存能装下 70B 量化模型还留长上下文。本文基于公开的 4 卡 vLLM 实测讲透三种并行方式的 GPU 利用率差异(TP 80-90% 胜出)、PCIe 互连下的通信开销,以及插槽带宽、供电散热、驱动掉卡、跨厂商混插五大坑,给出双卡/四卡的预算决策。48显存不够时怎么办:量化与 CPU offload 实战策略32GB 显存下跑 27B 模型的实用策略:量化精度取舍、offload 机制原理、层切分的真实效果与常见误区。49RX 7900 XTX 跑大模型实测:量化阶梯、ROCm 调优与两个反直觉点24GB RDNA3 卡跑 LLM 的完整画像:FP16/INT8/INT4 三档量化能装多大模型、Ollama num_ctx 与 num_batch 调参、HSA_OVERRIDE_GFX_VERSION 兜底,以及 24GB 不等于长上下文自由、Vulkan 可能比 ROCm 更快两个反直觉点,附散热与降压超频建议。