大模型部署

Splash

Apple Silicon 本地推理引擎:DFlash 2 推测解码 + Metal 内核,一条 brew 跑 Qwen3.8-27B

免费开源

Splash 是 incoai 出品的 Apple Silicon 本地推理引擎,Apache-2.0 许可,2026-09-18 创建,1,157 星,2026-10-04 仍在活跃推送。定位是围绕模型构建的本地推理引擎,专为 Apple M 系列芯片优化:内置 DFlash 2 推测解码、专用 Metal 内核、自动内存规划,自动复用缓存前缀并批量并发请求,支持视觉、工具调用、JSON Schema 输出、图像与内联 PDF,自带聊天页面。一条 brew 命令安装(brew install incoai/tap/splash),splash serve 即可在 127.0.0.1:8000 起服务,默认示例跑 unsloth/Qwen3.8-27B-GGUF 的 UD-Q4_K_M 量化版,4 位量化需要至少 36GB 统一内存(推荐 48GB),24GB 的 Mac 可以换更小的 GGUF 变体。API 同时兼容 OpenAI Chat Completions、Responses、Completions 和 Anthropic Messages,全支持流式。splash opencode / splash claude / splash codex / splash hermes 一条命令把对应编程智能体接到本地模型上,LM Studio Bionic 也有配套设置指南。硬件门槛:Apple M3 及以上、macOS 26.4 及以上。适合在 Mac 上本地跑 27B 级编程智能体、要推测解码提速度、要 OpenAI/Anthropic 双兼容 API 的开发者。