Meta 今天正式发布并开源 Llama 4,这是迄今为止最大的开源语言模型——参数规模达 4,000 亿(400B),采用 MoE(混合专家)架构,在多项基准测试中与 GPT-5 的差距缩小到 5% 以内。

💡 先给结论:如果你需要自己部署大模型(数据安全、定制化需求),Llama 4 是目前最好的选择。如果你只是日常使用,ChatGPT/Gemini/Claude 仍然更方便。

核心规格

Llama 4 (400B)Llama 4 (70B)Llama 3.1 (405B)
总参数4000亿700亿4050亿
激活参数800亿 (MoE)700亿4050亿
上下文窗口100万 token100万 token12.8万 token
多模态文本+图像+音频文本+图像仅文本
训练数据20万亿 token15万亿 token15万亿 token
许可Apache 2.0Apache 2.0Llama 3 许可

基准测试:离GPT-5还有多远?

测试Llama 4 (400B)GPT-5Claude 4 Opus
MMLU (综合知识)92.1%94.8%93.5%
HumanEval (代码)95.2%97.1%94.8%
GSM8K (数学推理)96.8%98.2%97.1%
MATH (高等数学)88.5%94.3%91.2%
GPQA (研究生级推理)78.3%83.6%80.1%

和 GPT-5 的平均差距在 3-5%。对于开源模型来说,这是历史性突破——一年前 Llama 3 和 GPT-4 的差距还在 15-20%。

MoE 架构:4000亿参数,只需800亿的算力

Llama 4 最聪明的地方在于混合专家(MoE)架构:虽然总参数 4,000 亿,但每次推理只激活其中的 800 亿。这意味着运行成本仅为同规模稠密模型的 1/5

这也是为什么 400B 版本可以在 8 张 H100 上跑起来(Llama 3.1 405B 需要 16 张)。

多模态能力

Llama 4 是 Meta 首个原生多模态开源模型:

  • 图像理解:可以看图回答问题、分析图表、识别物体
  • 音频处理:支持语音输入(ASR)和语音输出(TTS),端到端
  • 视频分析:可以理解视频内容(400B版本,需额外算力)

对行业的影响

✅ 利好:AI 民主化加速

  • 创业公司可以用 Llama 4 微调出垂直领域模型,成本大幅降低
  • 中国市场特殊利好:可以在本地部署高质量开源模型,无需依赖 API
  • 学术界获得了一个和商业模型同等水平的研究基线

⚠️ 挑战:安全与滥用

  • 4,000 亿参数的开源模型意味着任何人都能拥有相当于国家级 AI 的能力
  • Meta 的"安全对齐"在开源后可以被轻易去除
  • 深度伪造、自动化攻击的门槛进一步降低

怎么用?

  • Hugging Face:权重已上传,可直接下载
  • Together AI / Fireworks:提供托管 API,按token付费
  • Ollama:支持 70B 版本一键本地部署(400B 需要特殊配置)
  • Replicate:云端运行,按分钟计费