
M5 Ultra 256GB 统一内存,1.2TB/s 内存带宽——这个数字意味着什么?跑 ds-v4-flash 的 prefill 预计比 M3 Ultra 快 3-4 倍。
为什么统一内存带宽是本地推理的核心指标
本地大模型推理的瓶颈不是算力,是数据搬运。每生成一个 token,都要把模型权重从内存搬到计算单元;上下文越长,要搬的 KV 数据越多。所以内存带宽(GB/s)直接决定了 prefill 和 decode 的天花板。
M3 Ultra 的带宽是 819GB/s,M5 Ultra 是 1.2TB/s——接近 1.5 倍。但苹果官方数据显示 M5 Ultra 的 prefill 性能是 M3 Ultra 的 4 倍,远超带宽比的线性外推。这说明 M5 的矩阵计算单元(M 系列 GPU)对 MoE 模型的 expert 调度做了深度优化,不只是带宽红利。
数字推演(非实测)
| 上下文 | M3 Ultra 实测 | M5 Ultra ×3 预期 | M5 Ultra ×4 预期 |
|---|---|---|---|
| 1K prefill | 531 t/s | ~1590 | ~2120 |
| 4K prefill | 486.5 t/s | ~1460 | ~1950 |
| 64K prefill | 468.5 t/s | ~1410 | ~1870 |
| 128K prefill | 438.6 t/s | ~1320 | ~1750 |
| decode(MTP 关,1K) | 27.6 t/s | ~40 | — |
| decode(MTP 关,128K) | 21.3 t/s | ~31 | — |
256GB 版本的 M5 Ultra 定价 8.6 万。
为什么对 MoE 模型特别有价值
256GB 统一内存能完整放下 125B~150B 级别的 MoE 模型权重,不需要量化到极限。而且统一内存带宽 1.2TB/s 远超消费级显卡(7900XTX 是 960GB/s),MoE 模型每层激活的 expert 权重搬运速度直接翻倍。
一句话
如果预算到位,M5 Ultra 256GB 是目前"单卡"能跑 100B+ MoE 且 prefill 速度最快的平台——没有之一。代价是 8.6 万的定价和封闭生态。