克劳德·桑内特 4.5:会编程、使用电脑、保持正轨的特工

最后更新: 十月6 ,2025
  • Sonnet 4.5 具有持久的代理、更好的代码和可靠的计算能力,输出令牌为 64K,重点关注时间超过 30 小时。
  • Claude Code 更新(检查点、终端、VS Code),向 API 添加内存和上下文编辑,并启动 Agent SDK。
  • 它在安全性方面有所进步(ASL-3、更少的误报、防御提示注入)并且在 SWE-bench 和 OSWorld 中表现良好。
  • 可在 Claude.ai、API、Bedrock 和 Vertex AI 上使用,价格从 3 美元到 15 美元不等,并可节省缓存和批处理费用。

用于编程和代理的人工智能模型

Claude Sonnet 4.5 的问世点燃了人工智能在智能体和软件开发领域的应用,其前景涵盖自主编程、计算机操作,以及推理和数学方面的切实进步。Anthropic 公司将其视为迄今为止功能最强大的模型,并明确其目标:将 Claude 打造成超越对话助手的“行动型智能体”。

与此同时,该公司正通过改进 Claude Code、推出新的开发者工具以及更严格的安全和对齐层来强化其生态系统。其目标远大:打造代理、代码和计算使用方面的最佳模型,并以 SWE-bench Verified 和 OSWorld 等指标为支撑,此外还提供一系列旨在简化长期和更复杂任务的功能。

Claude Sonnet 4.5 是什么?它承诺什么?

Anthropic 将 Sonnet 4.5 描述为其在关键领域最强大的模型:构建复杂智能体、代码生成和维护以及计算机控制。它超越了简单的标签化;该公司声称,其推理和数学运算能力均有显著提升,而这两大支柱在涉及多个步骤和依赖关系的项目中至关重要。

该模型最显著的特点之一是能够连续30小时以上执行复杂任务,无需人工干预即可保持专注。实际上,这意味着智能体可以长时间持续执行协调性任务而不会迷失方向。此外,该模型支持输出多达64.000个令牌,这对于详细规划和生成大型代码块非常有用。

在公开的基准测试中,Anthropic 声称 Sonnet 4.5 在 SWE-bench Verified 测试中处于领先水平,该测试旨在衡量软件解决实际问题的能力。它在 OSWorld 测试中也表现出色,得分高达 61,4%,表明其在实际桌面环境中的性能得到了显著提升。该公司将 61,4% 的得分与几个月前 Sonnet 4 的 42,2% 进行了比较,这是一个相当大的进步。

除了原始性能之外,该公司还强调,这是其最契合的“前沿”模型:过度奉承、追求权力或支持妄想推理等令人担忧的行为已经减少,并且加强了对计算机使用场景和代理能力中快速注入攻击的防御。

Claude Sonnet 的功能和用例

生态系统更新:Claude 代码、应用程序和平台

Sonnet 4.5 版本带来了一次重大产品更新。Claude Code 引入了用户呼声最高的功能之一——检查点:它可以保存开发进度,并允许用户立即回滚到之前的状态。对于任何需要进行长时间迭代开发的用户来说,这项改进都能减少开发过程中的阻力,让他们更有信心探索不同的开发路径,而无需担心破坏现有代码。

除了重新设计的终端界面和面向Visual Studio Code 的原生扩展之外,Claude 还被直接集成到程序员日常使用的 IDE 中。如果目标是让该模型扮演更核心、更实际的角色,那么这无疑是向前迈出的重要一步。

在 API 方面,有两个关键组件:上下文编辑和用于存储和检索信息的新型内存工具。它们共同作用,使代理能够运行更长时间,过滤掉过时的上下文,并保持真正重要的信息可访问——这在工作流程持续数小时且需求随时变化时至关重要。

  如何使用 ChatGPT 和 AI 工具创建 WhatsApp 贴纸:完整指南

在克劳德的应用程序中,另一项重要的创新是能够在对话中运行代码并创建文件(文档、电子表格和演示文稿)。这使得模型能够在不离开聊天界面的情况下分析数据、生成内容并以办公格式输出,从而将理论与实践结合在同一对话中。

最后,Claude 的官方 Chrome 扩展程序已向加入候补名单的 Max 用户开放,为更顺畅、更可靠地自动化浏览器任务打开了大门。

Claude Agent SDK:构建您自己的代理的构建块

Anthropic 不仅展示了其旗舰产品的功能,还为其他开发者提供了定制所需的基础模块。全新的Claude Agent SDK与 Claude Code 共享相同的底层架构,旨在解决诸多难题:例如,长时间运行任务的内存管理、兼顾自主性和用户控制的权限系统,以及为实现共同目标而协作的子代理之间的协调。

该提案旨在将此SDK改造为一个可重用的基础架构,以便任何团队都能使用经过生产验证的工具构建自己的代理。Anthropic公司表示,尽管该SDK最初是为基于代码的应用程序开发的,但它在各种任务中都展现出了优势。

研究预览:“与克劳德一起想象”

除了 Sonnet 4.5 之外,Anthropic 还提供了一项名为“与 Claude 一起想象”的限时体验。在这个实验中,模型无需预设功能即可即时生成软件,并能实时响应用户交互。本质上,它展现了当一个功能强大的模型与合适的架构相结合时所能达到的成就。

Max 用户可免费预览五天,预览版可通过 claude.ai/imagine 访问。该公司将其描述为一次既轻松有趣又富有启发性的展示,全面展现了Sonnet 4.5在生成和自适应方面的强大功能。

安全、对准和 ASL-3 级别

Sonnet 4.5 的部署由 ASL-3 安全级别提供支持,该框架通过适当的安全措施调整模型的功能。这些措施包括旨在检测潜在危险输入和输出的分类器,重点关注 CBRN(化学、生物、放射性和核)环境。

Anthropic公司承认,这些分类器有时会将合法内容误判为有害内容。为了避免打断用户,他们建议用户使用风险较低的Sonnet 4继续对话。自他们首次介绍这些过滤器以来,误报率已降低了十倍;自5月份Claude Opus 4发布以来,误报率又降低了一半。他们承诺,分类器的识别能力将持续提升

此次调整不仅限于过滤器:训练和安全评估首次纳入了受机制可解释性启发的测试,旨在更好地理解和控制模型的内部行为。此外,针对提示注入的防御措施也得到了加强,这在系统浏览网页、运行虚拟桌面或执行操作时尤为重要。

可用性、集成和定价

Claude Sonnet 4.5 现已全面上线。开发者可以通过 Claude API 调用模型“claude-sonnet-4-5”来使用它。价格与上一代相同:每百万代币投入 3 美元,每百万代币流出 15 美元。

Anthropic 的基础设施具有成本优势:通过即时缓存节省高达90% 的成本,通过批量处理再节省 50% 的成本——这些数据专为高容量工作负载而设计。对于最终用户,Claude.ai(网页、iOS 和 Android)中的 Sonnet 4.5 提供聊天功能;对于企业用户,该功能原生支持 Claude 开发者平台,以及 Amazon Bedrock 和 Google Cloud Vertex AI。

在商业方面,他们提供免费套餐,但会话次数有限制,每五小时重置一次,并可按需发送数量不等的消息。而对于复杂的编程任务,Claude Code 则是领先的解决方案提供商。

  如何使用 DeepMind 并了解其对人工智能的真正影响

特色用例

Sonnet 4.5 被誉为智能体的理想模型:它几乎可以瞬间响应,或者根据任务需要展开清晰可见的逐步思考。API 用户能够精确控制模型的“思考”时长,在速度和深度之间进行选择。

在软件开发中,它涵盖了整个生命周期:规划、生成、维护、缺陷修复和大规模重构。庞大的输出上下文(高达 64K 个标记)有助于生成一致且全面的计划和代码。

就浏览器和桌面端的使用而言,它处于同类产品中的领先地位:它能够完成从竞品分析、采购到客户注册等一系列实际工作流程。我们的目标是随着时间的推移,不断提高其准确性和可靠性。

在网络安全领域,将 Sonnet 4.5 与 Claude Code 结合使用的团队可以部署代理,在漏洞被利用之前自动修补漏洞,从而将重点从被动检测转移到主动防御。

在金融领域,该模型可进行输入分析和复杂预测;例如,它可以监控全球监管变化并主动调整合规系统,从人工审计准备发展到智能风险管理。

在办公效率方面,它擅长创建和编辑办公文件(文档、电子表格、演示文稿)。在研究方面,它可以追踪内部和外部信息来源,从而在复杂的信息环境中整合知识。

在内容方面,他擅长运用对细微差别和语气的理解进行写作,从而创作出更具说服力的文本,并在更深的语义层面上进行分析,这对于市场营销、技术文档或企业沟通来说都是非常有价值的。

绩效和指标

Anthropic 提供的数据显示,Sonnet 4.5 在SWE-bench Verified 测试中取得了 77,2% 的成绩,这是其迄今为止在编程方面的最佳表现。在 OSWorld 测试中,其得分达到 61,4%,巩固了其作为最佳“计算机应用”模型的地位。这些指标得到了实际运行数据的支持,例如超过 30 小时的任务处理时间和 64 个令牌的输出能力。

该公司表示,Sonnet 4.5 能够帮助金融分析、网络安全和研究等高要求行业的代理商协调多个代理商并处理大量数据,同时满足这些领域所需的可靠性。

十四行诗家族的演变和4.5的地位

要理解这一飞跃,我们需要回顾一下。Sonnet 3.7 引入了一种混合推理模型,显著提升了编码、内容生成和数据分析的性能。随后,Sonnet 4进一步巩固了这一方法,其性能接近于新版本,足以满足用户助手和高容量任务的需求。

Sonnet 4.5 在此基础上更进一步:它的目标是成为长时间任务、复杂代理和计算机使用的最准确选择,并在编程、金融和网络安全方面拥有更丰富的领域知识。

真实案例和社区的评价

Anthropic公司报告称,他们让Sonnet 4.5连续运行30个小时,构建了一个Slack的副本。据该公司称,该代理在无人监督的情况下生成了11.000行代码,并在任务完成后停止运行。今年5月,他们的Opus 4模型曾连续运行约7个小时,因此此次的新纪录远远超过了之前的记录。

这个故事听起来很精彩,但宣传材料之外却隐藏着许多细节。像@midudev这样的开发者讲述了该模型如何用一条指令重构整个项目——应用诸如整洁架构之类的模式,生成成百上千行代码——但编译后却无法运行。其他人也反映了同样的问题:代码结构完美,外观专业,但在运行时却出错。

也有人指出,Anthropic公司并未展示所谓的Slack应用程序的完整运行过程,而只是声称自己开发了该应用程序——这在沟通和提供可验证代码演示之间存在显著差距。这种情况并非个例:在整个行业中,模型通过生成看起来非常漂亮的代码来不断改进,但如果没有大量的人工干预,它们往往仍然无法产生功能完善的解决方案。

  如何在 Windows 和 Mac 上安装和使用 LM Studio

公司内部对这些改进的评价甚至让团队自身都感到惊讶。Dianne Penn 指出,新模型在计算机使用方面比十月份的版本熟练了三倍,而且他们过去一个月一直在根据GitHub 和 Cursor 的反馈进行改进。Canva 的 Beta 测试用户表示,它有助于处理“复杂、需要长时间处理的任务”。Scott White 将其比作“幕僚长级别”:协调日程安排、分析数据和撰写报告。

其核心信息很明确:即使拥有强大的模型,仍然需要虚拟机、内存和上下文管理、多代理支持以及权限系统才能在生产环境中部署更可靠的代理。而这正是代理 SDK 和平台新功能旨在填补的空白。

竞争和市场定位

Sonnet 4.5 的发布被视为一场激烈竞争的一部分:OpenAI 正全力推进其下一代产品,而谷歌则坚持推进 Gemini 项目,双方的举措迫使所有公司加快研发步伐。在此背景下,长期智能体、直接计算机应用和自主编程是至关重要的领域,这些领域蕴含着巨大的商业价值。

谁能说服企业相信自己可以实现实际工作流程的自动化,并具备可控性和可靠性,谁就能赢得授权许可和大规模部署的机会。Anthropic 认为,将强大的模型与合适的(他们自己的)基础设施相结合,就能弥合演示与持续运营之间的差距。

采用建议和良好做法

如果您打算认真尝试使用 Sonnet 4.5,请记住,自主性并非没有代价。该模型可以执行的操作——读取和修改文件、移动数据、执行命令以及导航——都需要明确的规则和监管。启用权限系统、审计日志以及设定人工干预阈值对于降低风险至关重要。

在代码流程中,Claude Code 的检查点和 API 内存有助于安全地迭代。即便如此,建议自动化测试和验证流程,并在委派主要职责之前,分阶段(从影响较小的任务到关键组件)引入模型。

在哪里阅读更多内容以及如何开始

Anthropic 建议所有用户(包括应用程序、API 和 Claude Code)升级到 Sonnet 4.5。他们表示,此次升级在保持价格不变的情况下,性能得到了显著提升,可直接替代现有版本。Claude Code 的新功能对所有用户开放;开发者平台(包括 Agent SDK)的更新面向所有开发者社区开放;所有付费套餐均包含应用程序中的代码执行和文件创建功能。

关于技术细节和评估结果,该公司参考了其系统卡、模型页面和文档,以及工程出版物和网络安全研究文章。任何想要体验实时软件生成的用户都可以试用“Imagine with Claude”几天。

这些公告描绘出的图景展现了一个在代理、代码和计算机使用方面都树立了新标杆的模式,同时增强了可扩展性、安全性和开发者工具。实践与理论的契合度还有待观察,但种种迹象表明,该模式已日趋成熟,并且制定了切实可行的计划,以弥合“说得好”与“做得好”之间的差距。

克劳德 4-1
相关文章:
Claude 4:Anthropic 通过先进的编程和自主代理模型重新构想人工智能