M5 Ultra 统一内存架构示意

M5 Ultra 256GB 统一内存,1.2TB/s 内存带宽——这个数字意味着什么?跑 ds-v4-flash 的 prefill 预计比 M3 Ultra 快 3-4 倍。

为什么统一内存带宽是本地推理的核心指标

本地大模型推理的瓶颈不是算力,是数据搬运。每生成一个 token,都要把模型权重从内存搬到计算单元;上下文越长,要搬的 KV 数据越多。所以内存带宽(GB/s)直接决定了 prefill 和 decode 的天花板。

M3 Ultra 的带宽是 819GB/s,M5 Ultra 是 1.2TB/s——接近 1.5 倍。但苹果官方数据显示 M5 Ultra 的 prefill 性能是 M3 Ultra 的 4 倍,远超带宽比的线性外推。这说明 M5 的矩阵计算单元(M 系列 GPU)对 MoE 模型的 expert 调度做了深度优化,不只是带宽红利。

数字推演(非实测)

上下文 M3 Ultra 实测 M5 Ultra ×3 预期 M5 Ultra ×4 预期
1K prefill 531 t/s ~1590 ~2120
4K prefill 486.5 t/s ~1460 ~1950
64K prefill 468.5 t/s ~1410 ~1870
128K prefill 438.6 t/s ~1320 ~1750
decode(MTP 关,1K) 27.6 t/s ~40 —
decode(MTP 关,128K) 21.3 t/s ~31 —

256GB 版本的 M5 Ultra 定价 8.6 万。

为什么对 MoE 模型特别有价值

256GB 统一内存能完整放下 125B~150B 级别的 MoE 模型权重,不需要量化到极限。而且统一内存带宽 1.2TB/s 远超消费级显卡(7900XTX 是 960GB/s),MoE 模型每层激活的 expert 权重搬运速度直接翻倍。

一句话

如果预算到位,M5 Ultra 256GB 是目前"单卡"能跑 100B+ MoE 且 prefill 速度最快的平台——没有之一。代价是 8.6 万的定价和封闭生态。