FEATURED · 精选文章
部署教程2026 年大模型推理框架横评:vLLM / SGLang / TensorRT-LLM / Ollama 怎么选
四款主流推理框架 2026 年 10 月实时数据对比:vLLM 9.3 万星、Ollama 18.2 万星、SGLang 3.7 万星、TensorRT-LLM 1.5 万星——从吞吐量、显存效率、上手成本到适用场景,一张表说清该选谁。
KNOWLEDGE & PRACTICE
从部署教程、模型评测到行业观察,把复杂问题整理成可执行的路径。
FEATURED · 精选文章
部署教程四款主流推理框架 2026 年 10 月实时数据对比:vLLM 9.3 万星、Ollama 18.2 万星、SGLang 3.7 万星、TensorRT-LLM 1.5 万星——从吞吐量、显存效率、上手成本到适用场景,一张表说清该选谁。
LATEST ARTICLES · 其余文章
38我用一张 32G 的 AMD 显卡跑本地大模型:风扇、功耗、量化全部调到位后的最终答案一张 32GB 显存的 AMD 工作站卡(R9700)+ 普通主机跑本地大模型:逐路停转实测风扇映射、锁 250W 降温 8°C 且更安静、量化对撞证明瓶颈不在带宽、前缀缓存 32 倍加速,外加一张"别再折腾"负面清单——所有数字都是反复实测的终版答案。39NInfer 深度解析:专为单张 5090 而生的 C++/CUDA 推理引擎NInfer 是从头用 C++/CUDA 写的单 GPU 推理引擎,定位明确——榨干单张 RTX 5090 上的 Qwen 系列推理(Qwen3.6/3.8,文/图/视频)。本文对比它与 vLLM/SGLang 通用引擎的根本区别,拆解"单卡+单模型"为何能榨出性能,给出选型建议、与 Strata 的上下游关系与踩坑记录。40Strata 实测:一张消费级显卡 + 64G 内存,怎么把 125B 大模型跑通125B MoE 模型(24576 个专家)正常得几百 GB 显存才跑得动,Strata 把它落到一张 12-24GB N 卡 + 64GB 内存的普通主机上,一键安装,写出答案 60-95 tok/s、读 prompt 2000+ tok/s。本文整理官方 README 一手实测表、量化档位 vs 内存需求、整机分摊原理、双卡/AMD/长上下文进阶玩法与踩坑记录。412026 主流 LLM 推理引擎选型:vLLM / SGLang / LMDeploy / KTransformers / TensorRT-LLM 到底怎么选没有最快的推理引擎,只有最适合你场景的引擎。本文拆解 5 大主流推理引擎的核心技术(PagedAttention、RadixAttention、TurboMind 双引擎、CPU 极致优化、NVIDIA 内核融合),整理社区实测吞吐 / 延迟 / 显存数据,给出选型决策树与 6 个踩坑记录,帮你把"选引擎"这笔账算明白。42L40S 24GB:数据中心卡下放家用,跑大模型实测与选型L40S 与 4090 同代架构、同显存,但无游戏限制、ECC 可选、PCIe 满速。本文整理规格对比、社区实测、买 L40S 的决策框架与买前必知。43Tesla P40 24GB 性价比之王:实测数据与买前必知的坑2016 年上市的数据中心卡,2026 年二手 ¥1500 上下,"每 GB 显存成本"几乎无人能敌。本文整理 P40 性能底细、双卡跑 70B 可行性、买前必知的坑与决策框架。442026 开源旗舰五强横评:Qwen3.6 / DeepSeek V4 / GLM-5.1 谁能跑起来2026 年 4 月五款开源旗舰同场竞技。本文按"消费级硬件能不能跑"为主线,整理参数、架构、跑分、显存需求、许可协议,给出决策清单。45RTX 5090 32GB FP16 推理:14B 全精度 vs 4090 量化的实测对比32GB 显存让 14B 模型从"勉强跑"变成"从容跑全精度"。本文整理 5090 与 4090 在 14B 全精度推理上的公开实测:显存账、速度差、坑位与升级决策框架。46AMD 显卡本地部署大模型完全指南(ROCm 实战)基于你的 AMD 显卡,从零完成大模型本地部署的实战指南:ROCm 环境搭建、Ollama 与 vLLM 两种方案、27B 量化模型实测速度与显存占用,以及驱动、镜像、量化三大常见坑。47本地大模型实战对比:DeepSeek / Qwen / Llama 怎么选三款主流开源模型在本地场景下的定位差异、开源协议与选型建议,帮你在 32GB 显存下选对模型。4824GB 显存甜点区:RTX 3090 / 7900 XTX / 4090 本地大模型实测与选卡同样 24GB 显存,N 卡与 A 卡跑大模型的真实差距只有 10-14%——本文用公开实测数据讲透 24GB 能装多大模型、3090 与 4090 的速度差、7900 XTX 的量化阶梯,以及超频、PCIe 插槽、ROCm 环境三个最常踩的坑,给出按预算的选卡结论。49RTX 2080 Ti 22G 魔改卡实测:22GB 显存怎么来的、能跑什么、三件必须想清的风险2019 年的 Turing 卡把 11GB 显存换成 2GB 芯片堆到 22GB,约 1900 元拿到接近专业卡的容量。本文整理魔改原理、SDXL/SVD/大模型公开实测、Mats 验卡流程,以及无保修虚焊、矿卡来源、架构天花板三件买前必看的风险。