大模型部署

llama.cpp

纯 C/C++ 的 LLM 本地推理引擎

免费开源支持中文

llama.cpp 是一个用纯 C/C++ 实现的 LLM 推理引擎,无需 GPU 也能在 CPU 上流畅运行,对 GGUF 量化格式提供了原生支持。它跨平台、几乎零依赖,可编译到 Windows、macOS、Linux 乃至树莓派等设备,是本地与边缘设备推理的底层基石,大量本地推理工具都构建在它之上。工具完全开源,源代码公开,可自由部署与二次开发,团队能根据自身需求深度定制,无需向第三方厂商支付授权费用,长期使用成本极低。项目社区活跃,文档齐全,迭代频繁,遇到问题通常能在官方仓库或社区找到现成解答,学习与维护的门槛都比较低。