2026 年 4 月被称为"开源 AI 史上最卷的月份":Qwen 3.6、Gemma 4、Llama 4、GLM-5.1、DeepSeek V4 五款旗舰同场竞技。这篇按消费级硬件能不能跑为主线,把五款模型的参数、架构、跑分、显存需求、许可协议整理成决策清单——跑分是实验室的事,落地才是你的事。

一、五位选手基本盘

模型 实验室 总参数 激活参数 架构 许可
Qwen 3.6-35B-A3B 阿里 35B 3B 256 专家 MoE + 混合注意力(Gated DeltaNet + Gated Attention)+ 多 Token 预测 Apache 2.0
Gemma 4-31B Google 31B 31B(Dense) Dense,原生视觉+音频,E2B 变体可跑手机 Apache 2.0
Llama 4 Scout Meta 109B 17B 16 专家 MoE,交替 Dense+MoE 层 自定义(700M MAU 上限)
Llama 4 Maverick Meta 400B 17B 128 专家 MoE 自定义(700M MAU 上限)
GLM-5.1 智谱 754B ~45B MoE,华为昇腾训练 MIT
DeepSeek V4 DeepSeek ~1T ~37B MoE + Engram 条件记忆,338 种编程语言 自定义(商用有限制)

趋势一句话:MoE 是共识,稀疏比是核心效率指标,Agent 能力是下一个战场。

二、跑分对照(SWE-bench / 数学推理)

Benchmark Qwen 3.6 35B Gemma 4 31B Llama 4 Maverick GLM-5.1 DeepSeek V4
SWE-bench Verified 73.4% 52.0% ~65% ~78% 83.7%
SWE-bench Pro 49.5% 35.7% — 58.4%(超 GPT-5.4 的 57.7%) ~55%
AIME 2026 数学 92.7% 89.2% — 95.3% 99.4%
MMLU-Pro 85.2% 85.2% — — 92.8%
HumanEval — — — — 90.0%

三个关键发现:

  1. DeepSeek V4 原始分数最高(83.7% SWE-bench Verified + 90% HumanEval),但万亿参数自建要 16 张 H100——普通人的选项只剩 API。
  2. GLM-5.1 统治最难 benchmark:SWE-bench Pro 58.4%,长周期自主任务最强(单次会话 6000+ 工具调用、600+ 迭代循环、8 小时自主搭建 Linux 桌面)。
  3. Qwen 3.6 性价比碾压:73.4% SWE-bench、92.7% AIME,只激活 3B 参数——用 Gemma 4-31B 十分之一的算力打出更高分数。

三、自建成本:一张消费级卡能跑什么(决策核心)

模型 FP16 显存 INT4 显存 最低 GPU
Qwen 3.6-35B-A3B ~70GB ~18GB 1× RTX 4090 / 5090(INT4) ✅
Gemma 4-26B-A4B ~52GB ~14GB 1× 24GB 卡(INT4) ✅
Gemma 4-31B ~62GB ~16GB 1× 24GB 卡(INT4)✅
Llama 4 Scout ~220GB ~55GB 2× A100 80GB
Llama 4 Maverick ~800GB ~200GB 8× A100 80GB
GLM-5.1 ~1.5TB ~380GB 8× H100
DeepSeek V4 ~2TB ~500GB 16× H100

结论:2026 年只有 Qwen 3.6-35B-A3B 和 Gemma 4-26B-A4B 能在单张消费级 GPU 上以量化方式跑前沿级性能。 其余旗舰的自建成本是 $20-50+/hr 的集群,对普通人而言等于"API 专用"。

API 价格参考:Qwen 3.6 Plus 在 OpenRouter 上免费预览(1M 上下文、78.8% SWE-bench);Gemma 4-31B 最便宜($0.15/$0.60 每百万 token 输入/输出);DeepSeek V4 为 $0.30/$1.20。

四、按场景选型

场景 推荐 理由
消费级硬件自建编码 Agent Qwen 3.6-35B-A3B 73.4% SWE-bench + 3B 激活 + 一张 4090/5090 能跑 + Apache 2.0 无限制商用
最大编码能力(不在乎硬件) DeepSeek V4(API) 83.7% SWE-bench Verified,价格 $0.30/$1.20 合理
长周期自主任务(Agent 天花板) GLM-5.1(API/集群) SWE-bench Pro 第一,MIT 许可
整仓库级超大上下文 Llama 4 Scout 10M token 上下文,8M 内 95%+ 检索准确率(10M 极限 89%)
多模态 + 边缘/手机部署 Gemma 4 原生视觉+音频,E2B 变体跑手机,TF/JAX/PyTorch 生态最完善
零成本尝鲜 Qwen 3.6 Plus 预览版 OpenRouter 免费,1M 上下文,始终在线推理

许可提醒:Qwen 3.6 / Gemma 4 / GLM-5.1 是真开源(OSI 合规,无限制商用);Llama 4 的 700M MAU 上限和 DeepSeek 的自定义条款对大多数公司不构成问题,但天花板确实存在。

五、一句话总结

选模型不看谁跑分最高,看你的硬件预算、延迟容忍度和部署场景:手里有 24GB/32GB 消费卡的,Qwen 3.6-35B-A3B 是 2026 年的默认答案;要旗舰能力就老老实实调 API(Qwen 免费预览 / DeepSeek V4 / GLM-5.1)。MoE 稀疏激活比是今年效率革命的核心——激活参数而非总参数,才是消费级硬件的命门。