sglang/hero.jpg" alt="5090 SGLang 1M 上下文配置示意">

单卡 RTX 5090 32G + SGLang 跑 Qwen3.6-35B NVFP4:上下文拉到 1M(YaRN 4.0 扩展),KV cache fp8,分层缓存 24GB——出字快到"成篇文章吐出来"而不是逐字。

配置

项目 规格
GPU RTX 5090 32G
模型 Qwen3.6-35B-A3B-NVFP4-nvidia
引擎 SGLang
量化 modelopt_fp4
上下文 1,000,000(YaRN factor 4.0,原 262K 扩到 1M)
KV cache fp8_e4m3
显存占用 0.88
分层缓存 24GB(write_through + kernel 后端)

核心启动参数

--model-path …/Qwen3.6-35B-A3B-NVFP4-nvidia
--quantization modelopt_fp4
--json-model-override-args '{"text_config":{"max_position_embeddings":1048576,
  "rope_parameters":{"rope_type":"yarn","factor":4.0,
  "original_max_position_embeddings":262144}}}'
--context-length 1000000
--kv-cache-dtype fp8_e4m3
--mem-fraction-static 0.88
--enable-hierarchical-cache
--hicache-size 24
--hicache-write-policy write_through
--hicache-io-backend kernel

实测表现

关键设计点

  1. YaRN 4.0 把 262K 扩到 1M:RoPE 外推,不用重新训
  2. fp8 KV cache:1M 上下文下 KV 占显存太大,fp8 砍一半
  3. 分层缓存 24GB:热 prefix 放显存,冷的放内存,write_through 策略保证一致性
  4. NVFP4 量化:35B 模型 32G 显存放得下,速度远超 INT4

一句话

5090 单卡 + SGLang + NVFP4 + 分层缓存,是目前"1M 上下文 + 快 decode"组合里最成熟的 NVIDIA 方案。