
2026-09-23 小米公开 6 天强化学习训练账本并放出权重:MiMo-V2.6-Pro,总参数 1.02 万亿、激活参数 420 亿(MoE),Artificial Analysis 开源模型榜第一,智能体基准逼近头部闭源旗舰。训练算力成本约 350 万美元。这是本文的全部硬数据来源,一条不编。
基本档案
| 项目 | 值 |
|---|---|
| 模型 | MiMo-V2.6-Pro(小米开源旗舰) |
| 架构 | MoE(混合专家) |
| 总参数 | 1.02 万亿(1.02T) |
| 激活参数 | 420 亿(42B) |
| 榜单 | Artificial Analysis 开源模型榜 第一 |
| 智能体基准 | 逼近头部闭源旗舰 |
| 训练账本 | 6 天强化学习,算力成本约 350 万美元 |
| 权重 | 已开源放出(9/23) |
| 信源 | 掘金 AI 日报 2026-09-23(多源聚合,含 The Decoder 报道) |
为什么"1T 总参数 / 42B 激活"这个配比重要
MoE 的核心账:每次推理只付激活参数的算力成本,但拿到总参数的模型容量。
| 指标 | MiMo-V2.6-Pro | 含义 |
|---|---|---|
| 激活 42B | 推理时计算量约等于 42B 稠密模型 | 推理成本可控 |
| 总 1.02T | 专家容量是激活量的 24 倍 | 知识容量接近稠密 1T 级 |
| 激活/总比 | 约 4.1% | 典型的"少激活、多容量"MoE 设计 |
对照本站已实测的方案(125B 级 MoE:Strata/KTransformers 在消费卡上 9-149 tok/s):MiMo 激活 42B 意味着单张旗舰消费卡理论上够得着推理——具体速度要等权重实际跑出来,但 42B 激活这个量级在 5090/R9700 一档硬件上是可讨论的,不是天方夜谭。等权重落地后值得做一篇实测(本站惯例:prefill/decode 分开报 + 任务类型分表)。
注意:本文所有性能结论基于官方榜单口径。单卡实测数据本站尚未获得,不做推测。
350 万美元的 6 天 RL 账本
小米这次把强化学习阶段的账本公开了:
- RL 训练周期:6 天
- 算力成本:约 350 万美元
- 日均烧钱:约 58 万美元/天
这个数字的产业意义:万亿参数级开源模型的 RL 阶段成本已经降到一个中型公司一两周的预算级别。高性能开源模型的获取门槛被大幅拉低——这是官方新闻口径的原话,也是这次发布真正的杀伤力所在。
争议(单源,未交叉验证)
The Decoder 援引 Anthropic 说法,指控小米从 Claude 攫取训练数据。此条为单一信源转述的指控,未见小米方回应细节,标注为"未交叉验证",不作为事实引用。
对本站读者(本地部署党)的意义
- 开源榜单第一 = 后续量化生态会跟上:GGUF/量化版通常 2-4 周内出现(参考本站跟踪过的其他开源旗舰节奏)
- 激活 42B 是消费卡可玩区间:参考本站 125B MoE 实测经验(decode 9-149 tok/s 按量化档位),42B 激活 + 低比特量化在 24GB+ 显存上是可讨论目标
- 智能体基准逼近闭源旗舰:Agent 场景(tool call 密集、多轮)是 MiMo 的强项口径,本地跑 Agent 循环(参考本站 Hermes 拆解篇)值得列入候选模型
结论
1.02T 总参数开源 + 榜单第一 + 350 万美元公开账本,MiMo-V2.6-Pro 把"国产开源第一"的标杆又抬高了一档。对本地部署党,真正的看点是权重落地后的消费卡实测——本站会跟进。
信源:掘金 AI 日报 2026-09-23(daily.ai225.com 聚合)+ The Decoder(单源争议条,未交叉验证)