Meta 今天正式发布并开源 Llama 4,这是迄今为止最大的开源语言模型——参数规模达 4,000 亿(400B),采用 MoE(混合专家)架构,在多项基准测试中与 GPT-5 的差距缩小到 5% 以内。
💡 先给结论:如果你需要自己部署大模型(数据安全、定制化需求),Llama 4 是目前最好的选择。如果你只是日常使用,ChatGPT/Gemini/Claude 仍然更方便。
核心规格
| Llama 4 (400B) | Llama 4 (70B) | Llama 3.1 (405B) | |
|---|---|---|---|
| 总参数 | 4000亿 | 700亿 | 4050亿 |
| 激活参数 | 800亿 (MoE) | 700亿 | 4050亿 |
| 上下文窗口 | 100万 token | 100万 token | 12.8万 token |
| 多模态 | 文本+图像+音频 | 文本+图像 | 仅文本 |
| 训练数据 | 20万亿 token | 15万亿 token | 15万亿 token |
| 许可 | Apache 2.0 | Apache 2.0 | Llama 3 许可 |
基准测试:离GPT-5还有多远?
| 测试 | Llama 4 (400B) | GPT-5 | Claude 4 Opus |
|---|---|---|---|
| MMLU (综合知识) | 92.1% | 94.8% | 93.5% |
| HumanEval (代码) | 95.2% | 97.1% | 94.8% |
| GSM8K (数学推理) | 96.8% | 98.2% | 97.1% |
| MATH (高等数学) | 88.5% | 94.3% | 91.2% |
| GPQA (研究生级推理) | 78.3% | 83.6% | 80.1% |
和 GPT-5 的平均差距在 3-5%。对于开源模型来说,这是历史性突破——一年前 Llama 3 和 GPT-4 的差距还在 15-20%。
MoE 架构:4000亿参数,只需800亿的算力
Llama 4 最聪明的地方在于混合专家(MoE)架构:虽然总参数 4,000 亿,但每次推理只激活其中的 800 亿。这意味着运行成本仅为同规模稠密模型的 1/5。
这也是为什么 400B 版本可以在 8 张 H100 上跑起来(Llama 3.1 405B 需要 16 张)。
多模态能力
Llama 4 是 Meta 首个原生多模态开源模型:
- 图像理解:可以看图回答问题、分析图表、识别物体
- 音频处理:支持语音输入(ASR)和语音输出(TTS),端到端
- 视频分析:可以理解视频内容(400B版本,需额外算力)
对行业的影响
✅ 利好:AI 民主化加速
- 创业公司可以用 Llama 4 微调出垂直领域模型,成本大幅降低
- 中国市场特殊利好:可以在本地部署高质量开源模型,无需依赖 API
- 学术界获得了一个和商业模型同等水平的研究基线
⚠️ 挑战:安全与滥用
- 4,000 亿参数的开源模型意味着任何人都能拥有相当于国家级 AI 的能力
- Meta 的"安全对齐"在开源后可以被轻易去除
- 深度伪造、自动化攻击的门槛进一步降低
怎么用?
- Hugging Face:权重已上传,可直接下载
- Together AI / Fireworks:提供托管 API,按token付费
- Ollama:支持 70B 版本一键本地部署(400B 需要特殊配置)
- Replicate:云端运行,按分钟计费