Strata 实测:一张消费级显卡 + 64G 内存,怎么把 125B 大模型跑通

结论先行:Strata 让"125B 参数、正常得用几百 GB 显存才跑得动的模型"落到一张 12-24GB 的 N 卡 + 64GB 内存的普通游戏本/主机上,一键安装,写出答案 60-95 tokens/s(比你能读得快)。 核心思路一句话:GPU 只放最常用的一小撮"专家",全部 24576 个专家放内存,CPU 和 GPU 并行算,SSD 存查表——把整台电脑当成一个推理引擎来用。 适合谁:手里只有一张消费级显卡 + 够大内存、但想跑"服务器级"大模型的人。不适合谁:要高并发对外服务、要极致低延迟(它是"一次处理一个请求"的设计)。

1. 先说它是什么、跑的是什么模型

关键点:它不是"量化一个小模型硬塞进显卡",而是把 MoE 模型拆开放在整台电脑上——这是它和 llama.cpp/Ollama 这类"全放显存"方案最本质的区别。

2. 官方实测数据(RTX 5070 12GB + Ryzen 5 7600 + 64GB 内存)

来源:Strata 官方 README 实测,一手数据。换显卡、换内存、换量化档位都会变,下表是该配置的基准。

量化档位 写答案(短对话 tok/s) 写答案(128K 上下文 tok/s) 读 prompt(tok/s,32K 输入) 质量
Q2_0 93 74 2,170 good
IQ2_XS 79 63 2,090 better(官方推荐)
IQ3_XXS 62 49 1,750 great
IQ3_S 53 46 1,620 best(官方测试上对齐满精度模型)
Coder (IQ1_M) 55 43 2,180 编码特化版

几个读数:

量化档位 vs 内存需求

档位 需 RAM+VRAM 说明
Q2_0 37.6 GB 最快
IQ2_XS 39.2 GB 推荐
IQ3_XXS 47.0 GB
IQ3_S 54.8 GB 最好,对齐满模型

能不能装下:模型第 1 个分片(启动时加载的部分)里,专家进内存,其余进显卡,第 2 个分片(约 29GB 查表)留在 SSD。经验规则:内存 ≥ 第 1 分片 + 约 10GB(Windows 还要留给系统)。64GB 内存全部档位都装得下;48GB 只装得下 Q2_0 和 IQ2_XS。显卡大可以补内存小(低内存模式),但不能降低内存需求。

3. 它凭什么能塞进消费级硬件:原理拆解

MoE 模型本质是"一团队 24576 个专家,写每个词只用其中 10 个"。Strata 据此把工作分摊到整台电脑:

  1. 显卡:干每词都需要的那部分活,并常驻最常被调用的几千个专家,边用边学哪些最常用(expert cache)。
  2. 内存:存全部专家。显卡没有的那个专家被调用时,由 CPU 和显卡并行计算,谁也不等谁。
  3. SSD:存一张大查表(第 2 分片,约 29GB),每个词只读其中几小行。
  4. 猜了再校验(MTP):模型内置一个小快助手先猜接下来的几个词,大模型一次性校验全部猜测,保留它认同的、自己写下一个词——一步常常产出多个词,同质量下快 1.6-1.8 倍。助手只猜、大模型决定每个词,所以质量不掉。
  5. 长文本分片读:一次读最多 8192 个 token(字片),所以长文档能到 1,000+ tok/s。

技术来源:基于 llama.cpp / ggml(MIT)构建,思路借鉴 Splash、NInfer、HyperQwen。

4. 进阶玩法(都写在官方 docs 里)

5. 选型建议 + 踩坑记录

该用 Strata 的场景

别硬上的场景

踩坑

  1. 首次启动会卡 1-3 分钟:Strata 往内存加载 35-55GB 并锁一部分给显卡,鼠标可能冻几分钟——等,别关窗口。下次启动就快了。
  2. 很慢 + 硬盘灯狂闪 = 内存不够:关其他程序(浏览器吃内存很多)或换更小档位。
  3. "engine stopped unexpectedly" = 多半内存不够:重发一次,Strata 会自启;反复出现就关程序或换小档。
  4. 驱动太旧直接报错:先用 NVIDIA App 更到新版驱动,重启再跑。
  5. prompt 超上下文:对话太长,开新对话或重跑 SETUP.bat 选更大上下文。
  6. 换配置(上下文/卡/视觉)才需要 REINSTALL=1:换已存在的模型不用重 setup。
  7. 社区数据 vs 官方数据要分清:上文第 2 节数字是官方 README 一手实测;第 4 节的双卡 18-20% 提速也是官方给的;但社区里流传的"某卡跑 X tok/s"是个人配置,随内存/SSD 速度浮动,别直接照抄。

6. 参考来源

硬件规格与量化档位以 Strata 官方 GitHub 仓库 README / docs 为准;本文第 2 节为官方 README 一手实测(RTX 5070 12GB + 64GB),第 4 节双卡数据为官方给出;社区流传的单机数字随内存/SSD 速度浮动,非官方基线。