# M5 Ultra 256GB：1.2TB/s 带宽意味着什么

> M5 Ultra 256GB 统一内存、1.2TB/s 带宽，跑 MoE 的 prefill 预计比 M3 Ultra 快 3-4 倍。统一内存带宽是本地推理核心指标，MoE 每层 expert 搬运速度直接翻倍。

![M5 Ultra 统一内存架构示意](/assets/articles/lcz/m5ultra/hero.jpg)

> M5 Ultra 256GB 统一内存，1.2TB/s 内存带宽——这个数字意味着什么？跑 ds-v4-flash 的 prefill 预计比 M3 Ultra 快 3-4 倍。

## 为什么统一内存带宽是本地推理的核心指标

本地大模型推理的瓶颈不是算力，是**数据搬运**。每生成一个 token，都要把模型权重从内存搬到计算单元；上下文越长，要搬的 KV 数据越多。所以内存带宽（GB/s）直接决定了 prefill 和 decode 的天花板。

M3 Ultra 的带宽是 819GB/s，M5 Ultra 是 1.2TB/s——**接近 1.5 倍**。但苹果官方数据显示 M5 Ultra 的 prefill 性能是 M3 Ultra 的 **4 倍**，远超带宽比的线性外推。这说明 M5 的矩阵计算单元（M 系列 GPU）对 MoE 模型的 expert 调度做了深度优化，不只是带宽红利。

## 数字推演（非实测）

| 上下文 | M3 Ultra 实测 | M5 Ultra ×3 预期 | M5 Ultra ×4 预期 |
| --- | --- | --- | --- |
| 1K prefill | 531 t/s | ~1590 | ~2120 |
| 4K prefill | 486.5 t/s | ~1460 | ~1950 |
| 64K prefill | 468.5 t/s | ~1410 | ~1870 |
| 128K prefill | 438.6 t/s | ~1320 | ~1750 |
| decode（MTP 关，1K） | 27.6 t/s | ~40 | — |
| decode（MTP 关，128K） | 21.3 t/s | ~31 | — |

256GB 版本的 M5 Ultra 定价 8.6 万。

## 为什么对 MoE 模型特别有价值

256GB 统一内存能完整放下 125B~150B 级别的 MoE 模型权重，不需要量化到极限。而且统一内存带宽 1.2TB/s 远超消费级显卡（7900XTX 是 960GB/s），**MoE 模型每层激活的 expert 权重搬运速度直接翻倍**。

## 一句话

如果预算到位，M5 Ultra 256GB 是目前"单卡"能跑 100B+ MoE 且 prefill 速度最快的平台——没有之一。代价是 8.6 万的定价和封闭生态。


---
来源：https://laobanclaw.top/articles/m5-ultra-256gb-moe-prefill/（AI 军火库）
