数据来自抡锤者论坛(lcz.me)多篇热帖的社区实测,均为真实运行记录。模型以 Qwen 系列 27B 级别为主(含 Q4/FlashNext/Flash 等不同量化与架构)。tok/s 随量化、上下文、并发、驱动 / ROCm 版本不同会有波动,这里给的是"量级 + 选型参考",不是保证值。

一、各卡实测一览(Qwen 27B 级别)

硬件 配置 实测 备注
单卡 3090 Qwen3.8 FlashNext 约 100 tok/s 坏卡捡漏场景的性能天花板
7900 XTX Qwen3.8-27B 完整部署 约 73.4 tok/s 含完整部署与实测记录
7900 XTX + llama.cpp Qwen3.6 27B TurboQuant + MTP 多档 TurboQuant 量化 + MTP 投机解码
7900 XTX 双卡 SGLang 魔改 TP TTFT < 1s,平均 80–100 tok/s,4 并发 200 tok/s 双卡张量并行
RTX 3080 20G Qwen3.8 27B 约 60–30 tok/s 改 20G 显存的性价比方案
双 3090 NVLink Qwen3.6-27B 128K 上下文 高并发实测 长上下文场景

二、几条选型结论(从数据能读出来的)

  1. 单卡就够用时别上多卡:3090 单卡 100 tok/s 对绝大多数对话 / Agent 场景已绰绰有余,多卡只在"要并发、单卡装不下大模型"时才值得
  2. 量化 / 架构决定速度上限:同为 27B,FlashNext、TurboQuant、Q4 的 tok/s 差距很大——选卡前先定"跑哪个量化 / 架构",否则数字没法比
  3. 双卡 TP 的价值在并发:7900 XTX 双卡 SGLang TTFT < 1s、4 并发 200 tok/s,这种收益是"并发 + 大模型装不下单卡"才兑现的;单请求单卡跑,多卡基本白花钱(见我们的 P2P 实战篇)
  4. 20G 改显存的 3080 是性价比拐点:20G 显存 + 60 tok/s,对预算有限、要跑 27B 量化的人是务实选择,但要接受散热与供电的折腾

三、给"按预算选卡"的一句话建议

提醒:所有 tok/s 都是特定量化 + 特定环境下的实测,换模型 / 换 ROCm 版本 / 换上下文长度都会变。选型时把"我要跑哪个模型哪个量化"写死,再对着看,别拿不同配置的数字硬比。