2026 年 4 月被称为"开源 AI 史上最卷的月份":Qwen 3.6、Gemma 4、Llama 4、GLM-5.1、DeepSeek V4 五款旗舰同场竞技。这篇按消费级硬件能不能跑为主线,把五款模型的参数、架构、跑分、显存需求、许可协议整理成决策清单——跑分是实验室的事,落地才是你的事。
一、五位选手基本盘
| 模型 | 实验室 | 总参数 | 激活参数 | 架构 | 许可 |
|---|---|---|---|---|---|
| Qwen 3.6-35B-A3B | 阿里 | 35B | 3B | 256 专家 MoE + 混合注意力(Gated DeltaNet + Gated Attention)+ 多 Token 预测 | Apache 2.0 |
| Gemma 4-31B | 31B | 31B(Dense) | Dense,原生视觉+音频,E2B 变体可跑手机 | Apache 2.0 | |
| Llama 4 Scout | Meta | 109B | 17B | 16 专家 MoE,交替 Dense+MoE 层 | 自定义(700M MAU 上限) |
| Llama 4 Maverick | Meta | 400B | 17B | 128 专家 MoE | 自定义(700M MAU 上限) |
| GLM-5.1 | 智谱 | 754B | ~45B | MoE,华为昇腾训练 | MIT |
| DeepSeek V4 | DeepSeek | ~1T | ~37B | MoE + Engram 条件记忆,338 种编程语言 | 自定义(商用有限制) |
趋势一句话:MoE 是共识,稀疏比是核心效率指标,Agent 能力是下一个战场。
二、跑分对照(SWE-bench / 数学推理)
| Benchmark | Qwen 3.6 35B | Gemma 4 31B | Llama 4 Maverick | GLM-5.1 | DeepSeek V4 |
|---|---|---|---|---|---|
| SWE-bench Verified | 73.4% | 52.0% | ~65% | ~78% | 83.7% |
| SWE-bench Pro | 49.5% | 35.7% | — | 58.4%(超 GPT-5.4 的 57.7%) | ~55% |
| AIME 2026 数学 | 92.7% | 89.2% | — | 95.3% | 99.4% |
| MMLU-Pro | 85.2% | 85.2% | — | — | 92.8% |
| HumanEval | — | — | — | — | 90.0% |
三个关键发现:
- DeepSeek V4 原始分数最高(83.7% SWE-bench Verified + 90% HumanEval),但万亿参数自建要 16 张 H100——普通人的选项只剩 API。
- GLM-5.1 统治最难 benchmark:SWE-bench Pro 58.4%,长周期自主任务最强(单次会话 6000+ 工具调用、600+ 迭代循环、8 小时自主搭建 Linux 桌面)。
- Qwen 3.6 性价比碾压:73.4% SWE-bench、92.7% AIME,只激活 3B 参数——用 Gemma 4-31B 十分之一的算力打出更高分数。
三、自建成本:一张消费级卡能跑什么(决策核心)
| 模型 | FP16 显存 | INT4 显存 | 最低 GPU |
|---|---|---|---|
| Qwen 3.6-35B-A3B | ~70GB | ~18GB | 1× RTX 4090 / 5090(INT4) ✅ |
| Gemma 4-26B-A4B | ~52GB | ~14GB | 1× 24GB 卡(INT4) ✅ |
| Gemma 4-31B | ~62GB | ~16GB | 1× 24GB 卡(INT4)✅ |
| Llama 4 Scout | ~220GB | ~55GB | 2× A100 80GB |
| Llama 4 Maverick | ~800GB | ~200GB | 8× A100 80GB |
| GLM-5.1 | ~1.5TB | ~380GB | 8× H100 |
| DeepSeek V4 | ~2TB | ~500GB | 16× H100 |
结论:2026 年只有 Qwen 3.6-35B-A3B 和 Gemma 4-26B-A4B 能在单张消费级 GPU 上以量化方式跑前沿级性能。 其余旗舰的自建成本是 $20-50+/hr 的集群,对普通人而言等于"API 专用"。
API 价格参考:Qwen 3.6 Plus 在 OpenRouter 上免费预览(1M 上下文、78.8% SWE-bench);Gemma 4-31B 最便宜($0.15/$0.60 每百万 token 输入/输出);DeepSeek V4 为 $0.30/$1.20。
四、按场景选型
| 场景 | 推荐 | 理由 |
|---|---|---|
| 消费级硬件自建编码 Agent | Qwen 3.6-35B-A3B | 73.4% SWE-bench + 3B 激活 + 一张 4090/5090 能跑 + Apache 2.0 无限制商用 |
| 最大编码能力(不在乎硬件) | DeepSeek V4(API) | 83.7% SWE-bench Verified,价格 $0.30/$1.20 合理 |
| 长周期自主任务(Agent 天花板) | GLM-5.1(API/集群) | SWE-bench Pro 第一,MIT 许可 |
| 整仓库级超大上下文 | Llama 4 Scout | 10M token 上下文,8M 内 95%+ 检索准确率(10M 极限 89%) |
| 多模态 + 边缘/手机部署 | Gemma 4 | 原生视觉+音频,E2B 变体跑手机,TF/JAX/PyTorch 生态最完善 |
| 零成本尝鲜 | Qwen 3.6 Plus 预览版 | OpenRouter 免费,1M 上下文,始终在线推理 |
许可提醒:Qwen 3.6 / Gemma 4 / GLM-5.1 是真开源(OSI 合规,无限制商用);Llama 4 的 700M MAU 上限和 DeepSeek 的自定义条款对大多数公司不构成问题,但天花板确实存在。
五、一句话总结
选模型不看谁跑分最高,看你的硬件预算、延迟容忍度和部署场景:手里有 24GB/32GB 消费卡的,Qwen 3.6-35B-A3B 是 2026 年的默认答案;要旗舰能力就老老实实调 API(Qwen 免费预览 / DeepSeek V4 / GLM-5.1)。MoE 稀疏激活比是今年效率革命的核心——激活参数而非总参数,才是消费级硬件的命门。