大模型部署

pd-bridge

异构 prefill/decode:CUDA 卡 prefill + Mac Metal decode,普通 10GbE 网线互联

免费开源

pd-bridge 是 2026-09-06 创建的开源异构推理互联框架,Apache-2.0 许可,148 星。它解决多设备推理的 prefill/decode 分离问题:CUDA 卡(如 DGX Spark,vLLM)负责 prefill,Mac Studio(oMLX,Metal)负责 decode,两者之间只用普通 10GbE 以太网互联,不需要 NVLink 或 InfiniBand 这类高速互连硬件。DeepSeek-V4-Flash 是官方给出的目标模型。架构价值在于把两类异构硬件按工作负载特性分工——CUDA 的大算力矩阵单元吃 prefill 的计算密集段,Apple Silicon 的统一内存带宽吃 decode 的访存密集段,用一根万兆网线就能搭出单卡性能之上的推理链路,硬件投入远低于双卡同构方案。适合同时持有 NVIDIA 卡和 Mac 的开发者做低成本大模型服务器,也是本站 5090 加 Mac 分层缓存、backburner iPhone 帮 Mac 跑 27B 等端侧互联文章的同方向延伸。普通 10GbE 意味着布线与交换机成本可控,家庭或小型工作室即可部署。