结论先行:Strata 让"125B 参数、正常得用几百 GB 显存才跑得动的模型"落到一张 12-24GB 的 N 卡 + 64GB 内存的普通游戏本/主机上,一键安装,写出答案 60-95 tokens/s(比你能读得快)。 核心思路一句话:GPU 只放最常用的一小撮"专家",全部 24576 个专家放内存,CPU 和 GPU 并行算,SSD 存查表——把整台电脑当成一个推理引擎来用。 适合谁:手里只有一张消费级显卡 + 够大内存、但想跑"服务器级"大模型的人。不适合谁:要高并发对外服务、要极致低延迟(它是"一次处理一个请求"的设计)。
1. 先说它是什么、跑的是什么模型
- 项目:Strata(
github.com/Niko1221/Strata),MIT 开源,2026-10 社区数据约 4.6k star、510 commits、400 forks,迭代非常活跃。 - 跑的模型:Qwen3.8-Flash-Next(一个 MoE 架构大模型,含 24576 个"专家"小模块,每写一个词只用其中 10 个)。
- 硬件门槛:一张 NVIDIA RTX 20(0.1.27 起)/30/40/50 系列显卡、12GB 显存起步(越大越快)+ 64GB 内存 + Windows 10/11 或 Linux。
- 安装:
START-HERE.bat(Windows)/setup.sh(Linux)一键完成——它替你装好 Python、引擎、模型,只要求你自己先装一个新版 NVIDIA 驱动。 - 输出:本地
http://127.0.0.1:8080的 Web 界面(Chat + 实时监控 + About),同时暴露 OpenAI 兼容 API(/v1)和 Anthropic 兼容 API(/v1/messages),可以接你的应用、编码 Agent。
关键点:它不是"量化一个小模型硬塞进显卡",而是把 MoE 模型拆开放在整台电脑上——这是它和 llama.cpp/Ollama 这类"全放显存"方案最本质的区别。
2. 官方实测数据(RTX 5070 12GB + Ryzen 5 7600 + 64GB 内存)
来源:Strata 官方 README 实测,一手数据。换显卡、换内存、换量化档位都会变,下表是该配置的基准。
| 量化档位 | 写答案(短对话 tok/s) | 写答案(128K 上下文 tok/s) | 读 prompt(tok/s,32K 输入) | 质量 |
|---|---|---|---|---|
| Q2_0 | 93 | 74 | 2,170 | good |
| IQ2_XS | 79 | 63 | 2,090 | better(官方推荐) |
| IQ3_XXS | 62 | 49 | 1,750 | great |
| IQ3_S | 53 | 46 | 1,620 | best(官方测试上对齐满精度模型) |
| Coder (IQ1_M) | 55 | 43 | 2,180 | 编码特化版 |
几个读数:
- 读 prompt 能到 2,000+ tok/s:读一篇 32K 字的长文档/代码库,约 15 秒读完。这是 Strata 最夸张的能力——长文本"吃进去"极快。
- 显存越大越快:README 估算 RTX 3090(24GB)约 100-140 tok/s。因为更多模型能留在显卡上,少去内存/SSD 取。
- 量化越狠越快、质量越低:Q2_0 最快但质量 good;IQ3_S 最慢但质量 best(官方测试对齐满精度)。不确定就选 IQ2_XS(官方推荐)。
量化档位 vs 内存需求
| 档位 | 需 RAM+VRAM | 说明 |
|---|---|---|
| Q2_0 | 37.6 GB | 最快 |
| IQ2_XS | 39.2 GB | 推荐 |
| IQ3_XXS | 47.0 GB | |
| IQ3_S | 54.8 GB | 最好,对齐满模型 |
能不能装下:模型第 1 个分片(启动时加载的部分)里,专家进内存,其余进显卡,第 2 个分片(约 29GB 查表)留在 SSD。经验规则:内存 ≥ 第 1 分片 + 约 10GB(Windows 还要留给系统)。64GB 内存全部档位都装得下;48GB 只装得下 Q2_0 和 IQ2_XS。显卡大可以补内存小(低内存模式),但不能降低内存需求。
3. 它凭什么能塞进消费级硬件:原理拆解
MoE 模型本质是"一团队 24576 个专家,写每个词只用其中 10 个"。Strata 据此把工作分摊到整台电脑:
- 显卡:干每词都需要的那部分活,并常驻最常被调用的几千个专家,边用边学哪些最常用(expert cache)。
- 内存:存全部专家。显卡没有的那个专家被调用时,由 CPU 和显卡并行计算,谁也不等谁。
- SSD:存一张大查表(第 2 分片,约 29GB),每个词只读其中几小行。
- 猜了再校验(MTP):模型内置一个小快助手先猜接下来的几个词,大模型一次性校验全部猜测,保留它认同的、自己写下一个词——一步常常产出多个词,同质量下快 1.6-1.8 倍。助手只猜、大模型决定每个词,所以质量不掉。
- 长文本分片读:一次读最多 8192 个 token(字片),所以长文档能到 1,000+ tok/s。
技术来源:基于 llama.cpp / ggml(MIT)构建,思路借鉴 Splash、NInfer、HyperQwen。
4. 进阶玩法(都写在官方 docs 里)
- 双卡/多卡流水线:
START-HERE.bat会列出你的卡、问要不要跨卡共享模型。实测 RTX 5080 + RTX 3090,读 prompt 比单张 5080 快 18-20%,解码持平。每张卡保留自己那几层的专家,prompt 在卡间走流水线。要求每张卡是 RTX 20 系列及以上、≥8GB。 - 上下文:模型训练上限 262K;384K / 512K(实验)靠 rope scaling(yarn)外推,setup 会自动开。
- 思考强度:
off / low / medium / high——off 最快,high 适合难题。 - 图片:Chat 界面点 Picture /
chat.py里/image <path>/ 应用里直接附。 - AMD 卡(实验):
./setup.sh --backend hip——支持 Radeon RX 7900 XT/XTX、RX 9070/9070 XT、Radeon AI PRO R9700(Linux),ROCm 从 TheRock wheel 装、无需 sudo,现场编译 HIP 引擎;RX 6800/6900(gfx1030)为社区报告。多卡可用--gpus。 - Unsloth 4-bit UD-Q4_K_XL(实验):最接近满模型,但 111GB 下载、77GB 专家塞不进内存,Strata 把(内存-24GB)留 RAM、其余边答边从 SSD 读:64GB PC + 12GB GPU 上 7-8.5 tok/s,慢数倍、长 prompt 更慢,需 ≥48GB 内存 + NVMe SSD。
- 自校准:
START-HERE.bat --calibrate在你的机器上测几个引擎配置留最快的(约 5-10 分钟,官方那台让 Coder 快了 7%)。
5. 选型建议 + 踩坑记录
该用 Strata 的场景
- 只想在自己电脑跑"服务器级"大模型,显卡不超 24GB、但内存有 64GB。
- 长文档/代码库要反复"喂"给模型(读 prompt 2000+ tok/s 是真优势)。
- 想要一个本地 OpenAI 兼容端点,接自己的 Agent/应用,不想上云。
别硬上的场景
- 高并发对外服务:它是"一次处理一个请求"的设计,不适合生产 API 网关。
- 极致低延迟:MTP + 专家调度的延迟高于 vLLM/TensorRT-LLM 这类生产引擎。
- 内存只有 32-48GB:32GB 内存只能跑 Coder(IQ1_M),48GB 只能 Q2_0/IQ2_XS,档位受限。
踩坑
- 首次启动会卡 1-3 分钟:Strata 往内存加载 35-55GB 并锁一部分给显卡,鼠标可能冻几分钟——等,别关窗口。下次启动就快了。
- 很慢 + 硬盘灯狂闪 = 内存不够:关其他程序(浏览器吃内存很多)或换更小档位。
- "engine stopped unexpectedly" = 多半内存不够:重发一次,Strata 会自启;反复出现就关程序或换小档。
- 驱动太旧直接报错:先用 NVIDIA App 更到新版驱动,重启再跑。
- prompt 超上下文:对话太长,开新对话或重跑
SETUP.bat选更大上下文。 - 换配置(上下文/卡/视觉)才需要 REINSTALL=1:换已存在的模型不用重 setup。
- 社区数据 vs 官方数据要分清:上文第 2 节数字是官方 README 一手实测;第 4 节的双卡 18-20% 提速也是官方给的;但社区里流传的"某卡跑 X tok/s"是个人配置,随内存/SSD 速度浮动,别直接照抄。
6. 参考来源
硬件规格与量化档位以 Strata 官方 GitHub 仓库 README / docs 为准;本文第 2 节为官方 README 一手实测(RTX 5070 12GB + 64GB),第 4 节双卡数据为官方给出;社区流传的单机数字随内存/SSD 速度浮动,非官方基线。
- Strata(官方仓库,含 README 实测表 / COMMUNITY_BENCHMARKS / 论文 PDF):https://github.com/Niko1221/Strata
- 模型 Qwen3.8-Flash-Next(Qwen 官方):https://huggingface.co/Qwen/Qwen3.8-Flash-Next
- 编码特化版 Coder(ISTA-DASLab):https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF
- Unsloth UD-Q4_K_XL(实验 4-bit):https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
- 引擎基础 llama.cpp / ggml:https://github.com/ggml-org/llama.cpp