sglang/hero.jpg" alt="5090 SGLang 1M 上下文配置示意">
单卡 RTX 5090 32G + SGLang 跑 Qwen3.6-35B NVFP4:上下文拉到 1M(YaRN 4.0 扩展),KV cache fp8,分层缓存 24GB——出字快到"成篇文章吐出来"而不是逐字。
配置
| 项目 | 规格 |
|---|---|
| GPU | RTX 5090 32G |
| 模型 | Qwen3.6-35B-A3B-NVFP4-nvidia |
| 引擎 | SGLang |
| 量化 | modelopt_fp4 |
| 上下文 | 1,000,000(YaRN factor 4.0,原 262K 扩到 1M) |
| KV cache | fp8_e4m3 |
| 显存占用 | 0.88 |
| 分层缓存 | 24GB(write_through + kernel 后端) |
核心启动参数
--model-path …/Qwen3.6-35B-A3B-NVFP4-nvidia
--quantization modelopt_fp4
--json-model-override-args '{"text_config":{"max_position_embeddings":1048576,
"rope_parameters":{"rope_type":"yarn","factor":4.0,
"original_max_position_embeddings":262144}}}'
--context-length 1000000
--kv-cache-dtype fp8_e4m3
--mem-fraction-static 0.88
--enable-hierarchical-cache
--hicache-size 24
--hicache-write-policy write_through
--hicache-io-backend kernel实测表现
- 9 轮 50 步:23,206 tok/s(聚合吞吐,含 6.5M tok 处理量)
- 缓存命中 0%(冷启动)到 97%(热状态)
- 出字速度比云端 DeepSeek V4.1 flash 还快(V4.1 最快见过 346 tok/s)
- "基本上已经不是串流一个个字吐出来了,是成篇文章吐出来"
关键设计点
- YaRN 4.0 把 262K 扩到 1M:RoPE 外推,不用重新训
- fp8 KV cache:1M 上下文下 KV 占显存太大,fp8 砍一半
- 分层缓存 24GB:热 prefix 放显存,冷的放内存,write_through 策略保证一致性
- NVFP4 量化:35B 模型 32G 显存放得下,速度远超 INT4
一句话
5090 单卡 + SGLang + NVFP4 + 分层缓存,是目前"1M 上下文 + 快 decode"组合里最成熟的 NVIDIA 方案。