北京时间7月2日凌晨,Google在年度I/O大会上正式发布了Gemini 3大模型。这是继Gemini 2.5之后的又一次代际飞跃,在多项基准测试中全面超越OpenAI GPT-5和Anthropic Claude 4 Opus。
核心升级亮点
- 原生100万token上下文:无需任何变通方案,原生支持100万token上下文窗口,可一次处理《三体》三部曲体量的文本。在信息检索、长文档分析场景中表现惊艳。
- 全模态原生融合:文本、图像、音频、视频、代码五种模态在同一模型中深度对齐,无需额外适配层。在Video-MME视频理解基准上得分98.7%,比GPT-5高出12个百分点。
- 编程能力突破:在SWE-bench Verified上达到82.3%的解决率,超越GPT-5的76.1%和Claude 4 Opus的79.5%。支持从需求分析到部署上线的全链路自主编程。
- 推理效率提升3倍:采用新一代MoE架构和TPU v7芯片训练,推理速度相比Gemini 2.5提升3倍,成本降低60%。
重要特性详解
100万token上下文让Gemini 3可以一次性分析整个代码仓库、整本教科书或数小时的会议记录。在测试中,Gemini 3能够从500页的技术文档中精准定位信息,准确率接近100%。
多模态原生能力超越了传统的拼接式多模态方案。用户可以直接上传一段1小时的视频,Gemini 3能自动提取关键帧、识别对话、生成摘要,甚至分析场景中的情感变化。
Agent模式是本次发布的另一大亮点。Gemini 3内置了自主代理能力,可以规划、执行和修正多步任务——从预订行程到自动部署代码,无需人工干预。
定价与可用性
Gemini 3即日起通过Google AI Studio和Vertex AI开放API访问:
- Gemini 3 Flash:免费试用,/bin/sh.15/百万token(输入),/bin/sh.60/百万token(输出)
- Gemini 3 Pro:.50/百万token(输入),0.00/百万token(输出)
- Gemini 3 Ultra:5.00/百万token(输入),0.00/百万token(输出),计划7月下旬开放
消费者端,Gemini 3将逐步集成到Google搜索、Gmail、Google Docs等全线产品中。Google One AI Premium订阅用户(9.99/月)已可优先体验。
业界反响
AI社区对此反应热烈。知名AI研究员Andrej Karpathy评论称:Gemini 3的100万token上下文不是营销噱头,是真正的实用创新。它重新定义了理解的含义。
分析师指出,Google这次在模型能力、成本效率和应用生态三个维度同时发力,AI军备竞赛进入了一个新阶段。对于开发者而言,Gemini 3的低定价和强大的Agent能力将大幅降低AI应用开发门槛。