R9700 单卡跑 Qwen3.8-27B MXFP4:prefill 3300 tok/s 的完整配置与 4 个坑
RDNA4 没有原生 MXFP4 运算单元,原生 ROCm vLLM 会退回 BF16 模拟反量化慢 3-5 倍。4 组 R9700 单卡实测:vllm-radiance 原生 kernel 下 prefill 2300-3300 tok/s、decode 峰值 161 tok/s、8 并发聚合 152。附三套方案(打包镜像/裸配/NVFP4)完整启动参数和显存、并发、ROCm 版本四个坑。
R970032G
阅读完整指南