双子座3的特点:关注一切变化及其重要性。

最后更新: 23 11月的2025
  • Gemini 3 首次引入生成式界面,并提升了专家级推理能力。
  • 增强了多模态性能,拥有 1 万个令牌,并改进了图像和视频结果。
  • 功能更强大的代理:反重力、工作区集成和工具使用。
  • 广泛部署和增强安全性,可通过应用程序、搜索、AI Studio 和 Vertex AI 访问。

Gemini 3 功能

谷歌新一代人工智能的到来目标明确:从对话转向执行。凭借 Gemini 3,谷歌在推理、多模态和智能体能力方面实现了显著飞跃,并首次推出了一种全新的交互方式:模型能够即时生成界面,帮助用户快速达成目标,无需耗费时间在中间步骤上。

所有这些都伴随着应用程序的重新设计、Google 搜索、工作区和开发者工具的改进,以及对安全性的重点提升。所有用户都能感受到这些变化,但许多最重要的改进将体现在高级功能中:编程、数据分析、视频和图像处理,以及在人工监督下规划和执行的自动化代理。

什么是双子座3号?为什么它标志着一个转折点?

在实践中,这意味着更直接、更有用的回复,减少某些聊天机器人典型的“奉承”,以及更好地理解上下文,即使在处理冗长或异构的输入(文本、图像、视频、音频和代码)时也是如此。

此外,谷歌从一开始就在多个平台上部署了 Gemini 3:Gemini 应用、搜索引擎的 AI 模式、AI Studio、Vertex AI、模型的 CLI,以及一个名为Google Antigravity的新代理平台,该平台旨在规划和执行复杂的软件任务,并可访问编辑器、终端和浏览器。

为了强调此次发布的影响范围,该公司回顾了 Gemini 时代的累积影响:人工智能驱动的 View体验每月覆盖数十亿人,该应用程序的用户超过数亿,大多数 Google Cloud 客户已经在使用人工智能功能,数百万开发者已经利用其生成模型构建了解决方案。

双子座新闻 3

生成式界面和全新用户体验

Gemini 3 推出了一款界面更简洁、更现代的应用程序,让用户更容易发起对话,也更容易在“我的内容”文件夹中找到自己创建的东西。此次重新设计并非仅限于外观:最大的进步在于生成式界面,这是一种响应式设计,模型会确定最佳格式并生成动态视觉效果,而不是纯文本块。

首批实验包括“视觉设计”(杂志风格的视图,包含照片和互动模块)和“动态视图”,旨在探索和个性化搜索结果。例如,如果您让它“规划一次夏季罗马三日游”,您将获得一份可导航的视觉行程,其中包含后续问题和互动元素。

这个理念与所谓的“感觉编码”有关:你用自然语言描述目标,系统就会自动生成实现目标所需的界面或代码。因此,如果图表、动画或交互式小应用比一段文字更合适,Gemini 3 会在用户体验中直接生成它们,无需你切换工具。

购物体验也实现了飞跃:商品列表、比较表和价格直接从Google Shopping Graph(拥有数百亿条参考数据)整合,以构建交互式指南,无需离开购物流程,其风格类似于专门的推荐页面,但由模型动态生成。

  如何在不注册或创建帐户的情况下使用人工智能

另一个实际的改进是,在搜索引擎中,一部分订阅者可以选择Gemini 3 Pro的推理导向版本,以获得更全面、更有依据的摘要,而不仅仅是当前模式的合成响应。

Gemini 3 生成式界面

高级推理和深度思考模式

谷歌强调了Gemini 3 Pro在高难度测试中的显著提升:它展现了博士级别的推理能力,并在诸如“人类最后的考试”(Humanity's Last Exam,简称HLE)和GPQA Diamond等测试中取得了极具竞争力的成绩。具体来说,Gemini 3 Pro在HLE(不使用任何辅助工具)测试中取得了37,5%的正确率,在GPQA Diamond测试中取得了91,9%的正确率,并在数学方面展现了卓越的性能,在MathArena Apex测试中取得了23,4%的正确率

Gemini 3 的深度思考模式更进一步,能够应对特别复杂和新颖的挑战。在内部评估中,它在多个方面都优于专业版:在“人类最后的考试”(不使用工具)中得分 41,0%,在 GPQA Diamond 中得分 93,8%,在允许执行代码的 ARC-AGI 中得分 45,1%——ARC-AGI 结合了符号推理、工具使用和编程,旨在解决难题。

在智能体领域,该模型在Terminal-Bench 2.0 (54,2%) 中表现出良好的性能,该测试衡量了其通过终端处理计算机的能力,并在Vending-Bench 2等长时间环境中保持稳定的决策,在虚拟一年的商业模拟中实现了超过五千美元的净收益。

除了各项指标之外,更重要的是角色转变:从响应式助手转变为主动式代理。Gemini 3 会进行规划,将任务分解成多个步骤,并在必要时请求批准,并在人工监督下执行。它可以整理 Gmail 收件箱,通过交叉比对可用性来安排日程,或者通过结合推理、工具调用和导航来准备复杂的流程

开发者和企业用户已经看到了切实的改进:更清晰的视觉理解、更可靠的代码生成以及更高效的长时间运行任务性能。所有这些都将转化为更强大的代理,能够持续支持项目并长期保持进度。

双子座3中的推理和深度思考

多模态和大规模背景

Gemini 3 Pro 增强了其多模态理解能力,并提高了图像和视频处理的标准:它在 MMMU-Pro (81%) 和 Video-MMMU (87,2%) 测试中表现出色,并在 SimpleQA Verified (72,1%) 测试中展现了事实准确性方面的进步。其关键在于能够将文本、代码、照片、音频和视频片段整合到同一上下文中,并解读其中的关系和细微差别

该模型拥有1万个词元的上下文窗口,足以处理海量数据,足以容纳长篇文章、整个课程、代码库或多个并行运行的文档。这使得它能够应用于各种实际场景:从统一手写的家庭食谱(甚至包括多种语言的食谱)并将其转换为烹饪书,到将科学文章和长视频转换为交互式卡片和可视化图表

对于程序员而言,谷歌称其在代码分析、抽象推理和受控执行方面取得了重大突破。在诸如Code Assist 3.0之类的开发辅助场景中,它能够理解完整的代码库架构,并将上下文窗口扩展到多达 10 万个令牌,这有助于检测可能因本地更改而破坏的依赖关系。

  教育技术:释放每个学生潜能的关键

该模型还改进了视觉和文本数据的并行推理能力,从而优化了对表格、图表和界面的解读。当需要的不仅仅是“看到”图像,而是将其与文本和数字交叉比对以得出结论并采取行动时,这项进步至关重要。

因此,答案并不总是基于文本的:有时理想的答案是一个交互式网络应用程序(计算器、模拟器或实时小部件),它允许您在 Gemini 流程本身中更直观地探索解决方案。

双子座3号中的多模态和语境

代理、开发和谷歌反重力平台

Gemini 3 现已面向开发者开放,支持Google AI Studio、Vertex AI 和 CLI,并引入了Google Antigravity,这是一个基于代理的开发平台,可直接访问编辑器、终端和浏览器。该系统能够规划和执行端到端的软件任务,验证自身代码,并与 Gemini 系列中的其他界面(例如计算机控制和图像编辑界面)进行协调。

该模型在WebDev Arena(ELO 评分 1.487)等基准测试中名列前茅,在 Terminal-Bench 2.0 测试中获得 54,2% 的分数,并在 SWE-bench Verified 测试中取得 76,2% 的成绩,尤其擅长无需示例即可生成代码,并能根据复杂指令创建丰富的 Web 界面。对于企业而言,这可以加速定制化、基于代理的解决方案的开发。

现实世界的案例已经开始利用这项技术:一些公司创建自动化演示文稿时,会将技术文档输入模型,使其自动生成以前需要分析师花费数小时才能完成的内容。而借助 Gemini 3,由于其多模态推理和扩展的上下文信息,这项工作只需几分钟即可完成。

与 Google Workspace 和搜索引擎集成

对团队而言,最显著的影响将体现在Google Workspace中。Gemini 不再仅仅是一个侧边栏;它现在已集成到 Gmail、文档、表格、日历、YouTube 和地图等应用中,成为一个强大的引擎。例如,在 Gmail 中,它不仅提供摘要,还能根据您的实际空闲时间自动起草邮件、确定优先级、回复邮件并安排会议。在表格中,它扮演着数据分析师的角色,根据您的问题创建图表和数据透视表。

Gemini Vids也得到了整合,能够从 Drive 文档生成完整的视频演示文稿,并且增强了与多模态内容的协作:该模型能够理解和组合文本、图像和剪辑,从而在更短的时间内生成有用的资源。

搜索方面,除了人工智能驱动的摘要之外,部分订阅用户还可以升级到 Gemini 3 Pro,利用其强大的分析功能获得更丰富的搜索结果。在购物方面,Gemini 利用Google购物图谱生成包含最新价格和详细信息的推荐指南,且不会影响您的浏览体验。

另一个显著的改进是,搜索引擎可以更好地将您的问题分解成子查询,并代表您进行调查,从而更准确地理解您的意图,避免以前遗漏的内容。

总的来说,这种集成有望减少摩擦:您只需提出所需内容,如果合适,模型即可在同一流程中生成视图、表格、日历或小程序,而无需您在标签页之间切换。

可用性、部署和安全性

谷歌声称,Gemini 3 是迄今为止其最安全的模型,这得益于其实施过的最全面的评估。改进之处包括减少漏洞、增强对即时注入攻击的抵抗力,以及提升针对网络攻击相关滥用行为的防御能力,这些改进均已获得独立专家和外部机构(例如英国的 AISI)以及专业公司的验证。

  如何在不注册或登录的情况下使用人工智能

此次推广规模巨大:终端用户可在 Gemini 应用和搜索引擎的 AI 模式中找到它;开发者可通过Gemini API、AI Studio、Antigravity 和 CLI 使用它;企业用户则可通过 Vertex AI 和 Gemini Enterprise 使用它。一些高级功能,例如深度思考和某些智能体功能,最初仅面向Google AI Ultra订阅用户提供,并将随着时间的推移逐步扩展。

实用提示:Gemini 3 Pro从发布之日起即可在应用和网页上免费使用,这在以前是前所未有的,不过目前在搜索功能中升级到 Pro 版本仅限付费用户。此外,用户现在即可在 Google AI Studio 中试用该功能,其全面推广将在未来几天内根据地区和产品情况陆续推出。

谷歌用采用数据来佐证其推广计划:搜索引擎中的 AI 体验每月触达数十亿用户,应用程序用户远超 5 亿,超过 70% 的谷歌云客户使用 AI 功能,1300 万开发者利用其模型创建了解决方案。

企业应用及用例

在企业环境中,Gemini 3 支持设计定制化解决方案,将智能代理、自动化和多模态人工智能集成到关键流程中。这涵盖了从支持数据管道的开发和改进,到创建能够以统一方式处理文档、图像和视频的对话式体验等各个方面。

许多公司将这些功能与网络安全和渗透测试实践相结合,以保护模型和数据,并部署云基础设施(AWS 和 Azure),以确保可扩展性、可用性和合规性。在分析领域,仪表板和商业智能服务(例如 Power BI)被集成在一起,以将数据转化为可执行的决策,这依赖于模型的推理和可视化的生成。

该套件还受益于与谷歌搜索的集成,谷歌搜索能够将答案锚定到当前主题的可靠信息,从而最大限度地减少错误信息。在编程方面,Gemini 3 能够理解代码库架构,提出修改建议,并针对潜在的依赖项发出警报,从而节省技术团队的时间。

展望未来,谷歌预计会出现彻底的定制化:无需复杂的微调流程,即可私密且安全地根据您组织的风格、语气和专业知识进行调整。值得注意的是:虽然普通用户可能不会注意到所有变化,但技术和数据团队将会看到准确性、速度和可操作性方面的显著提升。

Gemini 3 通过结合高级推理、实用代理和生成式界面,重新定义了我们与 AI 的交互方式:更少的摩擦、更多的上下文,以及交互式体验的可能性,只需几个恰当的提示,即可引导您从目标到执行。

gemini robotics-0
相关文章:
谷歌通过其 Gemini Robotics AI 彻底改变了机器人技术