llamAmpere 是 JakeATX 发起的 llama.cpp 分支,MIT 许可,2026-09-07 创建,141 星,专攻 NVIDIA Ampere 架构(RTX 3090 / 3090 Ti)的推理性能优化。核心卖点是让老旗舰卡 Ampere 在长上下文下不掉速:官方示例为 qwen3.8 模型在 100K token 生成、温度 1 条件下稳定 95+ tok/s,并支持完整 262K 上下文窗口。这意味着 2020 年买的 RTX 3090 在 2026 年的模型尺寸下仍然是一线可用的推理卡,不用为 262K 长窗口换 40 系或 50 系硬件。作为 llama.cpp 分支,它继承 GGUF 量化生态与完整 CLI/服务端,同时叠加针对 Ampere SM 架构的内核优化,解决上游通用构建在 Ampere 长上下文下 decode 掉速的问题。适合手上是 3090 / 3090 Ti 24G、要跑 200K 级以上长上下文、不想花新硬件预算的本地部署用户;配合 125B 级 MoE 量化版(参考本站 Strata/KTransformers 实测)是性价比路线的重要一环。
大模型部署
llamAmpere
llama.cpp 分支专攻 RTX 3090/3090Ti:100K 生成 95+ tok/s、262K 全上下文
免费开源