# Strata 实测：一张消费级显卡 + 64G 内存，怎么把 125B 大模型跑通

> 125B MoE 模型（24576 个专家）正常得几百 GB 显存才跑得动，Strata 把它落到一张 12-24GB N 卡 + 64GB 内存的普通主机上，一键安装，写出答案 60-95 tok/s、读 prompt 2000+ tok/s。本文整理官方 README 一手实测表、量化档位 vs 内存需求、整机分摊原理、双卡/AMD/长上下文进阶玩法与踩坑记录。

# Strata 实测：一张消费级显卡 + 64G 内存，怎么把 125B 大模型跑通

> 结论先行：Strata 让"125B 参数、正常得用几百 GB 显存才跑得动的模型"落到一张 12-24GB 的 N 卡 + 64GB 内存的普通游戏本/主机上，一键安装，写出答案 60-95 tokens/s（比你能读得快）。
> 核心思路一句话：**GPU 只放最常用的一小撮"专家"，全部 24576 个专家放内存，CPU 和 GPU 并行算，SSD 存查表**——把整台电脑当成一个推理引擎来用。
> 适合谁：手里只有一张消费级显卡 + 够大内存、但想跑"服务器级"大模型的人。不适合谁：要高并发对外服务、要极致低延迟（它是"一次处理一个请求"的设计）。

## 1. 先说它是什么、跑的是什么模型

- **项目**：Strata（`github.com/Niko1221/Strata`），MIT 开源，2026-10 社区数据约 4.6k star、510 commits、400 forks，迭代非常活跃。
- **跑的模型**：Qwen3.8-Flash-Next（一个 MoE 架构大模型，含 **24576 个"专家"小模块**，每写一个词只用其中 10 个）。
- **硬件门槛**：一张 NVIDIA RTX 20（0.1.27 起）/30/40/50 系列显卡、**12GB 显存起步**（越大越快）+ **64GB 内存** + Windows 10/11 或 Linux。
- **安装**：`START-HERE.bat`（Windows）/ `setup.sh`（Linux）一键完成——它替你装好 Python、引擎、模型，只要求你自己先装一个新版 NVIDIA 驱动。
- **输出**：本地 `http://127.0.0.1:8080` 的 Web 界面（Chat + 实时监控 + About），同时暴露 **OpenAI 兼容 API**（`/v1`）和 **Anthropic 兼容 API**（`/v1/messages`），可以接你的应用、编码 Agent。

关键点：它不是"量化一个小模型硬塞进显卡"，而是把 MoE 模型**拆开放在整台电脑上**——这是它和 llama.cpp/Ollama 这类"全放显存"方案最本质的区别。

## 2. 官方实测数据（RTX 5070 12GB + Ryzen 5 7600 + 64GB 内存）

> 来源：Strata 官方 README 实测，**一手数据**。换显卡、换内存、换量化档位都会变，下表是该配置的基准。

| 量化档位 | 写答案（短对话 tok/s） | 写答案（128K 上下文 tok/s） | 读 prompt（tok/s，32K 输入） | 质量 |
|---------|:---:|:---:|:---:|------|
| Q2_0 | 93 | 74 | 2,170 | good |
| IQ2_XS | 79 | 63 | 2,090 | better（**官方推荐**） |
| IQ3_XXS | 62 | 49 | 1,750 | great |
| IQ3_S | 53 | 46 | 1,620 | best（官方测试上对齐满精度模型） |
| Coder (IQ1_M) | 55 | 43 | 2,180 | 编码特化版 |

几个读数：
- **读 prompt 能到 2,000+ tok/s**：读一篇 32K 字的长文档/代码库，约 15 秒读完。这是 Strata 最夸张的能力——长文本"吃进去"极快。
- **显存越大越快**：README 估算 RTX 3090（24GB）约 100-140 tok/s。因为更多模型能留在显卡上，少去内存/SSD 取。
- **量化越狠越快、质量越低**：Q2_0 最快但质量 good；IQ3_S 最慢但质量 best（官方测试对齐满精度）。不确定就选 **IQ2_XS**（官方推荐）。

### 量化档位 vs 内存需求

| 档位 | 需 RAM+VRAM | 说明 |
|------|:---:|------|
| Q2_0 | 37.6 GB | 最快 |
| IQ2_XS | 39.2 GB | 推荐 |
| IQ3_XXS | 47.0 GB | |
| IQ3_S | 54.8 GB | 最好，对齐满模型 |

**能不能装下**：模型第 1 个分片（启动时加载的部分）里，专家进内存，其余进显卡，第 2 个分片（约 29GB 查表）留在 SSD。经验规则：**内存 ≥ 第 1 分片 + 约 10GB**（Windows 还要留给系统）。64GB 内存全部档位都装得下；48GB 只装得下 Q2_0 和 IQ2_XS。显卡大可以补内存小（低内存模式），但**不能降低内存需求**。

## 3. 它凭什么能塞进消费级硬件：原理拆解

MoE 模型本质是"一团队 24576 个专家，写每个词只用其中 10 个"。Strata 据此把工作分摊到整台电脑：

1. **显卡**：干每词都需要的那部分活，并**常驻最常被调用的几千个专家**，边用边学哪些最常用（expert cache）。
2. **内存**：**存全部专家**。显卡没有的那个专家被调用时，由 **CPU 和显卡并行计算**，谁也不等谁。
3. **SSD**：存一张大查表（第 2 分片，约 29GB），每个词只读其中几小行。
4. **猜了再校验（MTP）**：模型内置一个小快助手先猜接下来的几个词，大模型一次性校验全部猜测，保留它认同的、自己写下一个词——**一步常常产出多个词**，同质量下快 1.6-1.8 倍。助手只猜、大模型决定每个词，所以质量不掉。
5. **长文本分片读**：一次读最多 8192 个 token（字片），所以长文档能到 1,000+ tok/s。

**技术来源**：基于 llama.cpp / ggml（MIT）构建，思路借鉴 Splash、NInfer、HyperQwen。

## 4. 进阶玩法（都写在官方 docs 里）

- **双卡/多卡流水线**：`START-HERE.bat` 会列出你的卡、问要不要跨卡共享模型。实测 RTX 5080 + RTX 3090，读 prompt 比单张 5080 **快 18-20%**，解码持平。每张卡保留自己那几层的专家，prompt 在卡间走流水线。要求每张卡是 RTX 20 系列及以上、≥8GB。
- **上下文**：模型训练上限 262K；**384K / 512K（实验）靠 rope scaling（yarn）外推**，setup 会自动开。
- **思考强度**：`off / low / medium / high`——off 最快，high 适合难题。
- **图片**：Chat 界面点 Picture / `chat.py` 里 `/image <path>` / 应用里直接附。
- **AMD 卡（实验）**：`./setup.sh --backend hip`——支持 **Radeon RX 7900 XT/XTX、RX 9070/9070 XT、Radeon AI PRO R9700**（Linux），ROCm 从 TheRock wheel 装、无需 sudo，现场编译 HIP 引擎；RX 6800/6900（gfx1030）为社区报告。多卡可用 `--gpus`。
- **Unsloth 4-bit UD-Q4_K_XL（实验）**：最接近满模型，但 111GB 下载、77GB 专家塞不进内存，Strata 把（内存-24GB）留 RAM、其余边答边从 SSD 读：64GB PC + 12GB GPU 上 7-8.5 tok/s，慢数倍、长 prompt 更慢，需 ≥48GB 内存 + NVMe SSD。
- **自校准**：`START-HERE.bat --calibrate` 在你的机器上测几个引擎配置留最快的（约 5-10 分钟，官方那台让 Coder 快了 7%）。

## 5. 选型建议 + 踩坑记录

**该用 Strata 的场景**
- 只想在自己电脑跑"服务器级"大模型，显卡不超 24GB、但内存有 64GB。
- 长文档/代码库要反复"喂"给模型（读 prompt 2000+ tok/s 是真优势）。
- 想要一个本地 OpenAI 兼容端点，接自己的 Agent/应用，不想上云。

**别硬上的场景**
- **高并发对外服务**：它是"一次处理一个请求"的设计，不适合生产 API 网关。
- **极致低延迟**：MTP + 专家调度的延迟高于 vLLM/TensorRT-LLM 这类生产引擎。
- **内存只有 32-48GB**：32GB 内存只能跑 Coder（IQ1_M），48GB 只能 Q2_0/IQ2_XS，档位受限。

**踩坑**
1. **首次启动会卡 1-3 分钟**：Strata 往内存加载 35-55GB 并锁一部分给显卡，鼠标可能冻几分钟——**等，别关窗口**。下次启动就快了。
2. **很慢 + 硬盘灯狂闪 = 内存不够**：关其他程序（浏览器吃内存很多）或换更小档位。
3. **"engine stopped unexpectedly" = 多半内存不够**：重发一次，Strata 会自启；反复出现就关程序或换小档。
4. **驱动太旧直接报错**：先用 NVIDIA App 更到新版驱动，重启再跑。
5. **prompt 超上下文**：对话太长，开新对话或重跑 `SETUP.bat` 选更大上下文。
6. **换配置（上下文/卡/视觉）才需要 REINSTALL=1**：换已存在的模型不用重 setup。
7. **社区数据 vs 官方数据要分清**：上文第 2 节数字是官方 README 一手实测；第 4 节的双卡 18-20% 提速也是官方给的；但社区里流传的"某卡跑 X tok/s"是个人配置，随内存/SSD 速度浮动，别直接照抄。

## 6. 参考来源

> 硬件规格与量化档位以 Strata 官方 GitHub 仓库 README / docs 为准；本文第 2 节为**官方 README 一手实测**（RTX 5070 12GB + 64GB），第 4 节双卡数据为官方给出；社区流传的单机数字随内存/SSD 速度浮动，非官方基线。

- Strata（官方仓库，含 README 实测表 / COMMUNITY_BENCHMARKS / 论文 PDF）：https://github.com/Niko1221/Strata
- 模型 Qwen3.8-Flash-Next（Qwen 官方）：https://huggingface.co/Qwen/Qwen3.8-Flash-Next
- 编码特化版 Coder（ISTA-DASLab）：https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-Coder-GGUF
- Unsloth UD-Q4_K_XL（实验 4-bit）：https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF
- 引擎基础 llama.cpp / ggml：https://github.com/ggml-org/llama.cpp


---
来源：https://laobanclaw.top/articles/strata-125b-moe-consumer-pc-realworld/（AI 军火库）
