
Google 9 月 30 日发布 Gemini 4 Argon:1M token 输出上限(上一代 64K,提升 15 倍),$2/百万输入、$10/百万输出,缓存输入五折。走分阶段发布——先给网络防御者和参与政府预审的用户。
先说结论
- 1M token 输出上限,行业领先(上一代 64K → 15 倍)【多源交叉:官方 blog + Reuters + Quantosei】
- 定价 $2/$10,缓存输入 5 折
- 分阶段发布(Fairwind 计划):先网络防御者 + 美国政府自愿预审用户
- Google 内部已用它做 C/C++ 大规模迁移 Rust(libgav1 视频解码 Rust 版提速 2.7x)、数据中心内存优化(已回收 300+ TiB)
一、环境硬件条件
云模型,本地视角:
| 组件 | 说明 |
|---|---|
| 本地对应 | 27B 档的长上下文压力:1M 输出上限意味着云端任务可以"一次吐完",本地长上下文(128K-256K)仍有不可替代的私有化场景 |
| 本地 agent | 长输出 agent 编排(如一次性生成完整代码库)上云更省成本 |
二、实测数据
| 指标 | 数据 | 来源 |
|---|---|---|
| 输出上限 | 1M token(上代 64K) | 官方 |
| 定价 | $2 / $10,缓存输入 5 折 | 官方 |
| Rust 迁移 | libgav1 Rust 版提速 2.7x | 官方(内部用例) |
| 内存优化 | 已回收 300+ TiB | 官方(内部用例) |
| 发布方式 | Fairwind 分阶段(网络防御者优先) | Reuters |
三、踩坑指南
- Fairwind 分阶段 = 拿不到就等:不在首批名单的用户要排队,别按"已全面上线"写依赖
- 1M 输出的 token 成本:输出 $10/百万,一次 1M 输出 ≈ $10,长输出场景算清账再调
- 2.7x 提速是 Rust 特定用例:不代表所有 C++→Rust 迁移都有这个幅度,引用要带口径
四、避坑指南
- "1M 上限"≠"1M 质量":输出上限和长上下文准确率是两回事,实测要看 100K+ 位置的实际准确率
- 缓存五折要配前缀复用:缓存价的前提是前缀命中,一次性请求吃不到
- 网络防御者优先发布:安全类功能可能比其他用户早拿到一批新能力,合规敏感团队走预审通道
五、配置清单
| 档位 | 架构 | 适合 |
|---|---|---|
| 长输出为主 | Gemini 4(1M 输出)+ 本地 27B(私有档) | 混合 |
| 私有化为主 | 本地 128K-256K 上下文 27B/70B | 数据不出域 |
| 代码迁移 | Gemini 4 + 本地静态检查兜底 | 大规模迁移项目 |
数据源:Google 官方 blog(Gemini 4 Argon)、Reuters(9/30)、Quantosei(10/1)。