
Reflection AI 10 月 5 日发布 Beam:501B 总参 / 23B 激活 MoE,面向 coding + agentic,官方称推理算力比 GLM 5.2 等更大开源模型省 3-4 倍。老卡跑大模型的新选项。
先说结论
- 501B 总参 / 23B 激活 MoE,coding + agentic 向【多源交叉:MarkTechPost + Unite.ai + Particle News】
- 23.8T token 预训练(清洗掉 95% 原始 web token)
- <4 周在 6,144 块 GB300 NVL72 上完成预训练(Goodput 92.3%)
- 目前 red-teaming 中,不能自托管,走 waitlist;Reflection 自己承认 Kimi K3 裸能力仍领先,Beam 卖点是推理时效率
一、环境硬件条件
23B 激活的 MoE 对本地很友好:
| 组件 | 估算 |
|---|---|
| 显存 | Q4 权重 ≈ 280GB+(全量 offload 路线);INT8 ≈ 520GB |
| 激活计算 | 23B 激活 ≈ 本站 27B 档位同量级 |
| 现实档位 | 32GB 单卡:可跑 INT4 + MoE offload(CPU 内存 256GB+),速度看 offload 带宽 |
| 对比 | 比 501B dense 方案(如 552B 全激活)显存压力小一个数量级 |
二、实测数据
本站实测待权重公开(waitlist 中)。官方/媒体口径:
| 指标 | 数据 | 来源 |
|---|---|---|
| 总参/激活 | 501B / 23B | 官方 |
| 预训练 token | 23.8T(清洗 95% web token) | 官方 |
| RL 阶段 | 10.5K 块 GB300 × 4 周、1 亿+ rollouts、最大 256K 上下文 | 官方 |
| 推理效率 | 比 GLM 5.2 等更大开源模型省 3-4x 推理算力 | 官方口径 |
| 上下文 | 最大 256K | 官方 |
三、踩坑指南
- waitlist 期别信"实测"营销:权重没放出前的任何本地速度数字都是二手转述
- MoE offload 速度看内存带宽:32GB 卡 + 256GB 内存跑 501B,瓶颈在 DDR5 带宽不是 GPU,别按激活参数估速度
- reasoning effort 参数要配:官方提供 reasoning effort 参数,默认档和 max 档的 token 消耗差一个数量级
四、避坑指南
- 别按 dense 501B 估显存:MoE 激活 23B,但权重是全量占显存/内存,INT4 也要 280GB+
- Kimi K3 仍是裸能力标杆:Reflection 自己说的,Beam 的差异化在效率不在能力,选型要看你的瓶颈是算力还是质量
- 256K 上下文的 KV 显存:FP8 KV cache 也占几十 GB,长上下文场景预留
五、配置清单
| 档位 | 配置 | 适合 |
|---|---|---|
| 本站 R9700 32GB | INT4 + MoE offload + 256GB 内存 | 可跑,速度待实测(offload 瓶颈) |
| 双卡 2x32GB | 权重分卡 + KV 全 GPU | 长上下文提速档 |
| 工作站 4x48GB | 权重全 GPU | 流畅档,等 10 月底权重放出后跟进 |
数据源:MarkTechPost(10/5)、Unite.ai、Particle News(10/5)。权重公开后本站将补 R9700 实测数据。