sglang/hero.jpg" alt="R9700 二次开发 SGLang 流程示意">
单卡 R9700 32G 二次开发 SGLang,Qwen3.8 27B 从 AWQ 改造成 MXFP4 原生内核:PP 2000 / TG 90 t/s,上下文 229K。
背景
看到有大佬在开发双 R9700 高并发方案,加上 SGLang 的缓存树优势,决定自己上手改造一个单卡版本——大多数人买不起两张卡,也没有能插两张卡的机器。
环境
| 项目 | 规格 |
|---|---|
| GPU | R9700 32G(gfx1201) |
| 系统 | ROCm 7.2.4 |
| 引擎 | SGLang v0.5.20 + 72 个编号补丁 |
| 模型 | Qwen3.8-27B 混合 GDN(AWQ 原始权重) |
核心改造:AWQ → MXFP4
把 Qwen3.8-27B 从 AWQ(INT4 checkpoint)改造成 MXFP4 原生内核。一句话总结:这条路买的是"用上 RDNA4 的 FP4 硬件"和"少读权重",不是省显存——MXFP4 权重其实略大于 AWQ(4.25 vs 4.125 bit/param)。
实测数据
| 指标 | 数值 |
|---|---|
| Prefill | 1913 t/s |
| Decode | 91.3 t/s |
| 上下文 | 229,376(KV 池 232,926 tokens) |
| 视觉能力 | 保留 |
| 相对最初可用状态(PP 1379、ctx 90K) | PP +39%、上下文 +154% |
| 相对 MXFP4 上线前 | TG +21% |
关键启动参数
MODEL=/data/models/qwen38-awq QUANT=awq MEMF=0.94 \
CTX=229376 MAMBA=3 CHUNK=2048 MAX_RUN=1一句话
单卡 R9700 + 二次开发 SGLang,是目前 RDNA4 平台上 27B 模型 prefill 最快的方案之一。代价是 72 个补丁的维护成本和 ROCm 的折腾成本。