
一台华南 X99 + 7900XTX,Windows 下跑 Qwen 27B 只有 12 t/s,首 token 卡 4 分钟。大多数人以为瓶颈是"AMD 驱动不给力、Vulkan 优化差、E5 CPU 拖后腿"。真相是:主板默认把显卡锁死在 256MB 的 Small BAR 窗口里。
一个被普遍误诊的问题
老平台(X99 + E5)上跑本地大模型,速度上不去是常态。社区的常见归因:
- AMD 的 Windows 驱动比 NVIDIA 差
- Vulkan 后端优化不如 CUDA
- 老 CPU 喂不饱显卡
这些都不是根因。 根因在主板层面:BIOS 默认只分配了 256MB 的 BAR(Base Address Register)窗口给显卡。模型运行时,显卡和内存之间的大量数据要反复穿过这个窄窗口,产生海量缺页中断和通信阻塞——这才是"12 t/s + 首 token 卡 4 分钟"的真正来源。
实测数据:开启前后断崖式对比
| 核心指标 | 开启 ReBAR 前(256MB 锁死) | 开启 ReBAR 后 | 提升幅度 |
|---|---|---|---|
| Token 生成(Decode) | 12.69 t/s(78.8 ms/token) | 37.55 t/s(26.6 ms/token) | +195.9% |
| Prompt 预填充(pp512) | 200~300 t/s | 820 t/s | +200%~300% |
| Prompt 预填充(pp2048) | 150~220 t/s | 803 t/s | +260% |
真实编程任务(DeepSeek Harness + Qwen3.8)的端到端体感差距更大:
- 开启前:首 token 平均等 4 分 0 秒,推理 12 t/s
- 开启后:首 token 19 秒,decode 37 t/s
怎么开(零成本)
基于华南 X99 原厂 BIOS,自行注入 ReBarDxe 补丁即可开启 Resizable BAR,不需要换主板,不需要换卡。核心是把 BAR 窗口从 256MB 放大到 4GB+,让显卡能一次性访问足够大的显存区域,消除反复缺页。
为什么这事对老平台特别重要
新主板(AM5、Z790 等)默认就支持 Resizable BAR,老平台(X99、X79)因为硬件年代问题,BIOS 里没这个选项,只能靠注入补丁打进去。这意味着:用二手老平台省钱跑大模型的人,大概率被这个"看不见的墙"卡着,还以为自己显卡不行。
一句话
如果你的老平台跑大模型慢得离谱,先查 BAR 窗口是不是被锁在 256MB。这一项修好,速度直接翻 3 倍,比换任何软件配置都值。