
Mistral 10 月 6 日发布 Large 4(内部代号 Le Chonk):1 万亿参数 MoE、激活 49B、160+ 语言、AA Cyber Index 82%。权重 10 月 27 日公开——开源圈要炸一次了。
先说结论
- 1T 总参 / 49B 激活 MoE,160+ 语言(含全部欧盟官方语言)【多源交叉:官方 + QZ + SiliconANGLE】
- 欧洲自家数据中心训练,训练算力口径两源不一致:QZ 说 4,000 块 Grace Blackwell,SiliconANGLE 说 3,800 块——官方正文未完整抓取,暂无法裁决(缺口标注)
- Dense200 视觉超 GPT-6 Astra 1%;定位"中国以外最强开源权重模型"
- 同期 €3B Series D 融资
一、环境硬件条件
本地要跑 1T MoE(激活 49B):
| 组件 | 门槛 |
|---|---|
| 显存 | Q4 量化约 550GB+(总参权重),单卡无解,多卡/多机 |
| 激活计算 | 49B 激活 ≈ 27B 两倍的计算量 |
| 内存 | 512GB+(offload 路线) |
| 现实档位 | 消费级硬件 2026 年内基本跑不动全量,看量化 + MoE offload 生态 |
本站 R9700 32GB:跑不了全量,10/27 权重放出后的可跑性看生态(vLLM/SGLang 对 MoE offload 的支持速度)。
二、实测数据
权重 10/27 才放出,本站实测待更新。已知的官方/媒体口径:
| 指标 | 数据 | 来源 |
|---|---|---|
| 总参/激活 | 1T / 49B | 官方 |
| 语言数 | 160+(全欧盟官方语言) | 官方 |
| 网络安全基准 | AA Cyber Index 82%(开源漏洞修补超开源对手) | 官方 |
| 视觉 | Dense200 超 GPT-6 Astra 1% | 官方 |
| 预训练 token | 23.8T(清洗掉 95% 原始 web token) | 官方(经二手媒体转述) |
三、踩坑指南
- 受限预览期别急着冲:10/6 发布是受限预览,权重 10/27 才公开,现在能拿到的只有 API 档
- 训练算力口径别引用错:4,000 块 vs 3,800 块两源不一致,写文章引用前等官方口径
- 1T 参数的显存直觉:总参 1T ≠ 需要 1T 显存,MoE 激活只有 49B,但权重是全量占显存——用 Q4 估算也要 550GB+
四、避坑指南
- 消费级"跑 1T"营销话术警惕:能跑的是 offload 版(慢一个数量级),别被标题骗
- 等 10/27 再谈本地:权重没出前的"实测"全是二手转述
- 对比基准要看口径:Dense200 超 Astra 1% 是视觉单项,不是综合智能指数
五、配置清单
| 档位 | 配置 | 适合 |
|---|---|---|
| 消费级(2026 现实) | 跑不了全量,用 API 或等 QAT/更小变体 | 个人 |
| 工作站 | 4x 48GB+ 或 2x 80GB 专业卡 + 512GB 内存 | 小团队 |
| 本站 | 10/27 后跟进 vLLM/SGLang offload 实测 | 待更新 |
数据源:Mistral 官方发布页、QZ(10/6)、SiliconANGLE(10/6)。训练算力口径分歧已标注为缺口。