Google今日正式发表全新一代大型语言模型Gemini3,并同步在GeminiApp、SearchAI模式、AIStudio、VertexAI等多项服务中推出Gemini3Pro。Google表示,Gemini3是目前最强的多模态与推理模型,在科学、数学、视觉理解与长程规划等多项重要AI基准测试上大幅领先前代。除了VibeCoding外,Gemini3也是最强的Agentic模型,这意味着AI可以帮你主动完成任务。
Google执行长:Gemini理解力已从文字图片进化成能“读空气”Google执行长SundarPichai指出,自Gemini系列推出近两年以来,AI产品已触及全球二十亿用户。每一代Gemini都建立在上一代的成果之上,Gemini1在原生多模态与长上下文方面带来突破,能处理更多也更复杂的资讯。Gemini2奠定代理(agentic)能力,推动推理与思考极限。
而现在,Gemini3:我们最智慧的一代模型,集结Gemini系列所有能力,让你能把任何想法带到现实。它在推理方面达到SOTA(state-of-the-art),能掌握深度与细腻度。无论是捕捉创造性想法中的微妙线索,或拆解层层重叠的艰难问题。
Gemini3也能更好理解你的请求背后的上下文与意图,让你不用苦想提示就能得到真正需要的答案。令人惊叹的是,短短两年内,AI已从能阅读文字与图片,进化到能读懂场面与情境(readingtheroom)。
推理能力突破:Gemini3在LMArena、科学推理与数学测试皆夺冠Gemini3Pro在最新评测中刷新多项纪录:
LMArena榜首:取得1501Elo分数。Humanity’sLastExam(学术推理):37.5%(无工具)。GPQADiamond(科学推理):91.9%。MathArenaApex(高难度数学):23.4%。MMMU-Pro:81%Video-MMMU:87.6%SimpleQAVerified:72.1%(提升事实准确度)这些结果代表Gemini3Pro在科学、数学、多模态推理中具备高度可靠性,可处理极为复杂的问题。
Google同步发布Gemini3DeepThink推理模式,在ARC-AGI-2(含程式执行)取得45.1%,推理能力更上一层。其他亮点还包括:
Humanity’sLastExam:41.0%GPQADiamond:93.8%Gemini3:更强的学习、执行与规划能力Gemini3是目前最强的vibecoding与代理式编程模型,具体评分包括:
WebDevArena:1487Elo(最高)Terminal-Bench2.0:54.2%(工具操作能力)SWE-benchVerified:76.2%(大型程式任务)它也支援Google全新的GoogleAntigravity代理式开发平台,AI能自主规划、编写程式、操作终端机、验证程式、操控浏览器等多步骤任务。AgenticAI指的是能主动采取行动、规划多步骤任务、并自主操作工具的AI系统。核心概念是:AI不再只是回答,而是能像助手一样,主动完成任务。
举例来说,当我输入:“帮我抓今日ETH价格并更新GoogleSheet。”,AgenticAI自己去查API并更新GoogleSheet。
大型语言模型意味着使用者输入一样的内容,可能因模型运算出不同结果而有截然不同的输出。而Gemini3在Vending-Bench2中可连续一年度保持一致决策,这意味Gemini3能协助你完成:
预约本地服务整理Gmail处理多步骤工作流程GeminiAgent今天起向GoogleAIUltra使用者开放。且Google表示,Gemini3是目前经过最多安全审查的模型,强化抗“拍马屁式生成”、防PromptInjection与网路攻击。DeepThink模式则将在完成额外安全测试后,提供给GoogleAIUltra订阅者。
这篇文章Google正式推出Gemini3:目前最强大的AIAgentic与VibeCoding大型语言模型最早出现于链新闻ABMedia。





