数据来自抡锤者论坛(lcz.me)多篇热帖的社区实测,均为真实运行记录。模型以 Qwen 系列 27B 级别为主(含 Q4/FlashNext/Flash 等不同量化与架构)。tok/s 随量化、上下文、并发、驱动 / ROCm 版本不同会有波动,这里给的是"量级 + 选型参考",不是保证值。
一、各卡实测一览(Qwen 27B 级别)
| 硬件 | 配置 | 实测 | 备注 |
|---|---|---|---|
| 单卡 3090 | Qwen3.8 FlashNext | 约 100 tok/s | 坏卡捡漏场景的性能天花板 |
| 7900 XTX | Qwen3.8-27B 完整部署 | 约 73.4 tok/s | 含完整部署与实测记录 |
| 7900 XTX + llama.cpp | Qwen3.6 27B TurboQuant + MTP | 多档 | TurboQuant 量化 + MTP 投机解码 |
| 7900 XTX 双卡 SGLang | 魔改 TP | TTFT < 1s,平均 80–100 tok/s,4 并发 200 tok/s | 双卡张量并行 |
| RTX 3080 20G | Qwen3.8 27B | 约 60–30 tok/s | 改 20G 显存的性价比方案 |
| 双 3090 NVLink | Qwen3.6-27B 128K 上下文 | 高并发实测 | 长上下文场景 |
二、几条选型结论(从数据能读出来的)
- 单卡就够用时别上多卡:3090 单卡 100 tok/s 对绝大多数对话 / Agent 场景已绰绰有余,多卡只在"要并发、单卡装不下大模型"时才值得
- 量化 / 架构决定速度上限:同为 27B,FlashNext、TurboQuant、Q4 的 tok/s 差距很大——选卡前先定"跑哪个量化 / 架构",否则数字没法比
- 双卡 TP 的价值在并发:7900 XTX 双卡 SGLang TTFT < 1s、4 并发 200 tok/s,这种收益是"并发 + 大模型装不下单卡"才兑现的;单请求单卡跑,多卡基本白花钱(见我们的 P2P 实战篇)
- 20G 改显存的 3080 是性价比拐点:20G 显存 + 60 tok/s,对预算有限、要跑 27B 量化的人是务实选择,但要接受散热与供电的折腾
三、给"按预算选卡"的一句话建议
- 预算紧、能折腾:3080 20G / 捡漏坏卡 3090(坏卡捡漏另见我们的行情文)
- 要 AMD 生态 + 32G:R9700 是 32G 显存下跑 27B Q4 的甜点
- 要并发 / 大模型:7900 XTX 双卡 SGLang,但先把 P2P 链路(BIOS + ACS)搞定再谈
提醒:所有 tok/s 都是特定量化 + 特定环境下的实测,换模型 / 换 ROCm 版本 / 换上下文长度都会变。选型时把"我要跑哪个模型哪个量化"写死,再对着看,别拿不同配置的数字硬比。