# Reflection Beam：501B 开源权重 MoE，推理算力省 3-4 倍

> 23B 激活的 coding/agent 向开源 MoE，23.8T token 预训练。老卡跑大模型的新选项：显存估算与 offload 路线。

![eflection AI 10 月](/assets/articles/news/reflection-beam-501b-open/hero.jpg)
> Reflection AI 10 月 5 日发布 Beam：501B 总参 / 23B 激活 MoE，面向 coding + agentic，官方称推理算力比 GLM 5.2 等更大开源模型省 3-4 倍。老卡跑大模型的新选项。

## 先说结论

- 501B 总参 / 23B 激活 MoE，coding + agentic 向【多源交叉：MarkTechPost + Unite.ai + Particle News】
- 23.8T token 预训练（清洗掉 95% 原始 web token）
- <4 周在 6,144 块 GB300 NVL72 上完成预训练（Goodput 92.3%）
- 目前 red-teaming 中，不能自托管，走 waitlist；Reflection 自己承认 Kimi K3 裸能力仍领先，Beam 卖点是推理时效率

## 一、环境硬件条件

23B 激活的 MoE 对本地很友好：

| 组件 | 估算 |
|---|---|
| 显存 | Q4 权重 ≈ 280GB+（全量 offload 路线）；INT8 ≈ 520GB |
| 激活计算 | 23B 激活 ≈ 本站 27B 档位同量级 |
| 现实档位 | 32GB 单卡：可跑 INT4 + MoE offload（CPU 内存 256GB+），速度看 offload 带宽 |
| 对比 | 比 501B dense 方案（如 552B 全激活）显存压力小一个数量级 |

## 二、实测数据

本站实测待权重公开（waitlist 中）。官方/媒体口径：

| 指标 | 数据 | 来源 |
|---|---|---|
| 总参/激活 | 501B / 23B | 官方 |
| 预训练 token | 23.8T（清洗 95% web token） | 官方 |
| RL 阶段 | 10.5K 块 GB300 × 4 周、1 亿+ rollouts、最大 256K 上下文 | 官方 |
| 推理效率 | 比 GLM 5.2 等更大开源模型省 3-4x 推理算力 | 官方口径 |
| 上下文 | 最大 256K | 官方 |

## 三、踩坑指南

1. **waitlist 期别信"实测"营销**：权重没放出前的任何本地速度数字都是二手转述
2. **MoE offload 速度看内存带宽**：32GB 卡 + 256GB 内存跑 501B，瓶颈在 DDR5 带宽不是 GPU，别按激活参数估速度
3. **reasoning effort 参数要配**：官方提供 reasoning effort 参数，默认档和 max 档的 token 消耗差一个数量级

## 四、避坑指南

- **别按 dense 501B 估显存**：MoE 激活 23B，但权重是全量占显存/内存，INT4 也要 280GB+
- **Kimi K3 仍是裸能力标杆**：Reflection 自己说的，Beam 的差异化在效率不在能力，选型要看你的瓶颈是算力还是质量
- **256K 上下文的 KV 显存**：FP8 KV cache 也占几十 GB，长上下文场景预留

## 五、配置清单

| 档位 | 配置 | 适合 |
|---|---|---|
| 本站 R9700 32GB | INT4 + MoE offload + 256GB 内存 | 可跑，速度待实测（offload 瓶颈） |
| 双卡 2x32GB | 权重分卡 + KV 全 GPU | 长上下文提速档 |
| 工作站 4x48GB | 权重全 GPU | 流畅档，等 10 月底权重放出后跟进 |

数据源：MarkTechPost（10/5）、Unite.ai、Particle News（10/5）。权重公开后本站将补 R9700 实测数据。


---
来源：https://laobanclaw.top/articles/reflection-beam-501b-open/（AI 军火库）
