2026年夏天,开源AI模型进入了一个新的分水岭。Meta、DeepSeek和Mistral三家分别交出了自己的旗舰模型,开源阵营第一次在多个核心指标上追平甚至超越了闭源模型。
Meta在7月底正式开源了Llama 4系列。旗舰版Llama 4 400B拥有4000亿参数,采用混合专家(MoE)架构,实际激活参数约80B。在MMLU、HumanEval、GSM8K等标准评测中,Llama 4 400B的得分已经与GPT-4o持平。
更重要的是——它是真正开源的。模型权重、训练代码、数据配比全部公开,允许商用。这意味着任何公司都可以基于Llama 4做微调部署,不再依赖OpenAI或Google的API。
不过400B参数也意味着极高的部署门槛:推理至少需要8张H100显卡,约20万美元的硬件成本。对此Meta同时推出了Llama 4 70B和8B两款"小"模型,70B版本在单张H100上就能流畅运行。
深度求索在8月初发布的DeepSeek V3,在编程能力上引发震动。HumanEval得分94.2%,超过GPT-4o(92.0%)和Claude 4 Sonnet(93.1%),成为目前代码能力最强的开源模型。
DeepSeek V3走了一条不同的技术路线。它不是一味堆参数(总参数约230B,MoE激活参数约21B),而是在训练效率和推理成本上下功夫。推理价格仅为GPT-4o的1/20,API定价0.5元/百万token。
对国内开发者来说,DeepSeek V3还有一个独特优势:中文理解能力远超Llama 4。在中国历史、文学作品、网络用语等本土化场景中,DeepSeek V3的表现甚至好于GPT-4o。
法国Mistral AI也不甘示弱。Mistral Large 2在多语言能力上做了重点突破,支持包括法、德、西、中、日、阿拉伯等12种语言的本地化推理。在法语和德语场景中,它的表现超过了所有竞争对手。
Mistral Large 2的另一个亮点是指令遵循能力——在MT-Bench评测中得分9.2/10,意味着它能更准确地理解和执行复杂的多步骤指令。
| 模型 | 参数 | HumanEval | MMLU | 开源 | API价格(元/百万token) |
|---|---|---|---|---|---|
| GPT-4o | 未公开 | 92.0% | 88.7% | ❌ | 72 |
| Claude 4 Sonnet | 未公开 | 93.1% | 89.2% | ❌ | 55 |
| Llama 4 400B | 400B(MoE) | 91.5% | 88.9% | ✅ | 自己部署 |
| DeepSeek V3 | 230B(MoE) | 94.2% | 87.3% | ✅ | 0.5 |
| Mistral Large 2 | 未公开(MoE) | 90.8% | 88.1% | ✅ | 35 |
一个明显的趋势是:专长化正在替代"全能冠军"叙事。DeepSeek V3在编程上最强,Mistral Large 2在多语言上最强,Llama 4在综合能力上最均衡——开源模型不再是一个同质化的群体,而是各自在细分领域追赶甚至超越闭源模型。
对于企业用户来说,2026年下半年面临一个关键决策:是继续付高昂的API费用给OpenAI,还是转向开源模型自主部署?