eflection AI 10 月

Reflection AI 10 月 5 日发布 Beam:501B 总参 / 23B 激活 MoE,面向 coding + agentic,官方称推理算力比 GLM 5.2 等更大开源模型省 3-4 倍。老卡跑大模型的新选项。

先说结论

一、环境硬件条件

23B 激活的 MoE 对本地很友好:

组件 估算
显存 Q4 权重 ≈ 280GB+(全量 offload 路线);INT8 ≈ 520GB
激活计算 23B 激活 ≈ 本站 27B 档位同量级
现实档位 32GB 单卡:可跑 INT4 + MoE offload(CPU 内存 256GB+),速度看 offload 带宽
对比 比 501B dense 方案(如 552B 全激活)显存压力小一个数量级

二、实测数据

本站实测待权重公开(waitlist 中)。官方/媒体口径:

指标 数据 来源
总参/激活 501B / 23B 官方
预训练 token 23.8T(清洗 95% web token) 官方
RL 阶段 10.5K 块 GB300 × 4 周、1 亿+ rollouts、最大 256K 上下文 官方
推理效率 比 GLM 5.2 等更大开源模型省 3-4x 推理算力 官方口径
上下文 最大 256K 官方

三、踩坑指南

  1. waitlist 期别信"实测"营销:权重没放出前的任何本地速度数字都是二手转述
  2. MoE offload 速度看内存带宽:32GB 卡 + 256GB 内存跑 501B,瓶颈在 DDR5 带宽不是 GPU,别按激活参数估速度
  3. reasoning effort 参数要配:官方提供 reasoning effort 参数,默认档和 max 档的 token 消耗差一个数量级

四、避坑指南

五、配置清单

档位 配置 适合
本站 R9700 32GB INT4 + MoE offload + 256GB 内存 可跑,速度待实测(offload 瓶颈)
双卡 2x32GB 权重分卡 + KV 全 GPU 长上下文提速档
工作站 4x48GB 权重全 GPU 流畅档,等 10 月底权重放出后跟进

数据源:MarkTechPost(10/5)、Unite.ai、Particle News(10/5)。权重公开后本站将补 R9700 实测数据。