M5 Max 128GB 统一内存测试环境示意

Mac Studio M5 Max 128GB 跑 Qwen3.8 Flash-Next 128K 上下文:prefill 1900 tok/s、decode 49 t/s,agent workload 全项 PASS。

测试环境

项目 规格
硬件 Mac Studio M5 Max,128GB 统一内存
模型 Qwen3.8-Flash-Next(MTPLX Optimized-Speed + Uncensored oQ5e)
Context 131,072
Runtime oMLX 0.7.0.dev2
模型占用 原生约 94.65GB

所有长上下文测试都实际检查答案或 tool arguments 的正确性,不是只看 HTTP 200。

oQ5e 长上下文实测(MTP OFF)

场景 Prompt / completion Wall time 结果
32K 检索 32,704 / 18 26.90s PASS
64K 检索 65,472 / 18 43.75s PASS
128K 检索 131,007 / 18 102.69s PASS
近 128K 工具调用 130,862 / 44 103.41s PASS
15K 无 assistant 工具历史 15,131 / 57 14.07s PASS

近 128K tool call 最后正确回传 report_probe(value=7)——oQ5e 的 128K 检索和 tool calling 没有明显正确性问题。

MTPLX Optimized-Speed 128K

指标 数值
128K 检索 prefill 1900.4 tok/s
128K 检索 decode 49.36 tok/s
近 128K 工具调用 prefill 1816.4 tok/s
正确性 PASS

为什么这组数据有价值

M 系列统一内存跑 MoE 的价值不是峰值 tok/s,而是长上下文 + tool calling 的稳定性。128K 上下文下 prefill 1900 t/s 意味着 13 万 token 的 prompt 约 68 秒读完,decode 49 t/s 对 coding agent 完全够用。而且 oQ5e 这种 uncensored 量化在 128K 下 tool call 依然精准——这点比速度更关键。