大模型部署

Strata

125B MoE 在单张消费级显卡 + 大内存上跑通,一键安装,OpenAI/Anthropic 兼容 API

免费开源支持中文

Strata 是 2026 年最热门的消费级大模型推理方案之一(GitHub 约 4.6k star、MIT 开源),它把 125B 参数、含 24576 个专家的 MoE 模型落到一张 12-24GB 的 NVIDIA 显卡 + 64GB 内存的普通主机上,一键安装即可跑,写出答案 60-95 tokens/s(比你能读得快),读 prompt 可达 2,000+ tokens/s。它的核心思路是把 MoE 模型拆开放在整台电脑上:显卡只常驻最常用的一小撮专家、全部专家放内存、CPU 与显卡并行计算、SSD 存查表,再配合 MTP(小模型猜词、大模型一次校验)一步产出多个词。它暴露本地 OpenAI 兼容(/v1)与 Anthropic 兼容(/v1/messages)API,可接自己的应用与编码 Agent;支持双卡流水线(实测 5080+3090 读 prompt 快 18-20%)、rope scaling 外推到 384K/512K 上下文、AMD(RX 7900 XT/XTX、R9700 等)实验支持。

F

FlagAttention (FlagOpen)

大模型部署

国产 FlashAttention 加速库,支持 Ampere 及以上 N 卡,降低 attention 显存与延迟

免费开源中文了解更多