扩展阅读

Claude Sonnet 4.5 发布

Anthropic·2026/7/21·7 阅读

Claude Sonnet 4.5 发布 \ Anthropic

来源: https://www.anthropic.com/news/claude-sonnet-4-5 抓取时间: 2026-07-21 16:26:29


公告

Claude Sonnet 4.5 发布

2025年9月29日

Claude Sonnet 4.5 发布

Claude Sonnet 4.5 是世界上最好的编码模型。它是构建复杂智能体的最强模型。它是使用计算机最好的模型。它在推理和数学方面也显示出实质性的进步。

代码无处不在。它运行着您使用的每一个应用程序、电子表格和软件工具。能够使用这些工具并通过困难问题进行推理是现代工作完成的方式。

Claude Sonnet 4.5 使这一切成为可能。我们正在发布它,同时对我们的产品进行一系列重大升级。在 Claude Code 中,我们添加了检查点——这是我们最受欢迎的功能之一——它可以保存您的进度,并允许您立即回滚到以前的状态。我们更新了终端界面,并发布了原生 VS Code 扩展。我们为 Claude API 添加了新的上下文编辑功能和记忆工具,使智能体能够运行更长时间并处理更大的复杂性。在 Claude 应用程序中,我们将代码执行和文件创建(电子表格、幻灯片和文档)直接引入对话。我们还为上个月加入等待名单的 Max 用户提供了 Claude for Chrome 扩展。

我们还为开发者提供了我们自己用来制作 Claude Code 的构建块。我们称之为 Claude 智能体 SDK。为我们前沿产品提供动力——并使它们能够充分发挥潜力——的基础设施现在可以供您构建使用。

这是我们迄今为止发布的最符合对齐标准的前沿模型,与以前的 Claude 模型相比,在对齐的几个领域显示出巨大的改进。

Claude Sonnet 4.5 今天在所有地方都可用。如果您是开发者,只需通过 Claude API 使用 claude-sonnet-4-5。价格与 Claude Sonnet 4 相同,为每百万令牌 3 美元/15 美元。

前沿智能

Claude Sonnet 4.5 在 SWE-bench Verified 评估中是最先进的,该评估衡量真实世界的软件编码能力。实际上,我们观察到它在复杂的多步骤任务上保持专注超过 30 小时。

显示前沿模型在 SWE-bench Verified 上表现的图表,Claude Sonnet 4.5 领先

Claude Sonnet 4.5 在计算机使用方面代表了重大飞跃。在 OSWorld(一个测试 AI 模型在真实世界计算机任务上的基准)上,Sonnet 4.5 现在以 61.4% 的成绩领先。就在四个月前,Sonnet 4 还以 42.2% 的成绩保持领先。我们的 Claude for Chrome 扩展利用了这些升级的能力。在下面的演示中,我们展示了 Claude 直接在浏览器中工作、导航站点、填写电子表格和完成任务。

该模型还在包括推理和数学在内的广泛评估中显示出改进的能力:

比较前沿模型在流行公开评估上的基准表 Claude Sonnet 4.5 是我们迄今为止最强大的模型。请参阅脚注了解方法论。

金融、法律、医学和 STEM 领域的专家发现,与包括 Opus 4.1 在内的旧模型相比,Sonnet 4.5 显示出显著更好的领域特定知识和推理能力。

金融、法律、医学、STEM

该模型的能力也反映在早期客户的体验中:

我们看到 Claude Sonnet 4.5 实现了最先进的编码性能,在长期任务上有显著改进。它强化了为什么许多使用 Cursor 的开发者选择 Claude 来解决他们最复杂的问题。 Michael Truell,CEO

Claude Sonnet 4.5 放大了 GitHub Copilot 的核心优势。我们的初步评估显示多步骤推理和代码理解有显著改进——使 Copilot 的智能体体验能够更好地处理跨越代码库的复杂任务。 Mario Rodriguez,首席产品官

Claude Sonnet 4.5 在软件开发任务方面非常出色,学习我们的代码库模式以提供精确的实现。它通过深度上下文理解处理从调试到架构的所有事情,改变了我们的开发速度。 Eric Wendelin,开发者生产力 GenAI 技术主管

Claude Sonnet 4.5 将我们 Hai 安全智能体的平均漏洞接收时间减少了 44%,同时提高了 25% 的准确率,帮助我们自信地降低企业风险。 Nidhi Aggarwal,首席产品官

Claude Sonnet 4.5 在最复杂的诉讼任务方面是最先进的。例如,分析完整的简报周期并进行研究,为法官合成出色的意见初稿,或审视整个诉讼记录以创建详细的简易判决分析。 Pablo Arredondo,CoCounsel 副总裁

Claude Sonnet 4.5 的编辑能力非常出色——我们在 Sonnet 4 上的错误率从 9% 降到了内部代码编辑基准的 0%。以更低的成本获得更高的工具成功率是智能体编码的重大飞跃。Claude Sonnet 4.5 完美平衡了创造力和控制。 Michele Catasta,总裁

Claude Sonnet 4.5 在我们最复杂、长上下文的任务中带来了令人印象深刻的进步——从代码库中的工程到产品内功能和研究。它明显更智能,是一个巨大的飞跃,帮助我们推动 2.4 亿+用户可以用 Canva 设计的内容。 Danny Wu,AI 产品主管

Claude Sonnet 4.5 在早期测试中显著改进了 Figma Make,使提示和迭代更容易。团队可以使用更多功能性原型和更流畅的交互来探索和验证他们的想法,同时仍然获得 Figma 闻名的设计质量。 David Kossnick,AI 产品主管

Sonnet 4.5 代表了新一代编码模型。它通过并行工具执行最大化每个上下文窗口的动作,例如同时运行多个 bash 命令,效率惊人。 Jeff Wang,CEO

对于 Devin,Claude Sonnet 4.5 将规划性能提高了 18%,端到端评估分数提高了 12%——这是自 Claude Sonnet 3.6 发布以来我们看到的最大跳跃。它擅长测试自己的代码,使 Devin 能够运行更长时间、处理更困难的任务并交付生产就绪代码。 Scott Wu,联合创始人兼 CEO

Claude Sonnet 4.5 显示出红队测试的强大前景,生成创造性的攻击场景,加速我们研究攻击者策略的方式。这些见解加强了我们在端点、身份、云、数据、SaaS 和 AI 工作负载方面的防御。 Sven Krasser,数据科学高级副总裁兼首席科学家

Claude Sonnet 4.5 重置了我们的期望——它处理 30+ 小时的自主编码,使我们的工程师能够在大大减少的时间内完成数月的复杂架构工作,同时在大型代码库中保持连贯性。 Sean Ward,CEO 兼联合创始人

对于复杂的金融分析——风险、结构化产品、投资组合筛选——带思考的 Claude Sonnet 4.5 提供了需要较少人工审查的投资级见解。当深度比速度更重要时,这对于机构金融来说是有意义的一步。 Stian Kirkeberg,AI 和机器学习主管

01 / 13

我们迄今为止最符合对齐标准的模型

除了是我们最有能力的模型之外,Claude Sonnet 4.5 还是我们迄今为止最符合对齐标准的前沿模型。Claude 改进的能力和我们广泛的安全训练使我们能够大幅改进模型的行为,减少令人担忧的行为,如谄媚、欺骗、权力寻求以及鼓励妄想思维的倾向。对于模型的智能体和计算机使用能力,我们在防御提示注入攻击方面也取得了相当大的进展,这是使用这些能力的用户面临的最严重风险之一。

您可以在 Claude Sonnet 4.5 系统卡中阅读详细的安全和对齐评估集,其中首次包括使用机械可解释性技术的测试。

自动行为审计器的整体未对齐行为分数(越低越好) 自动行为审计器的整体未对齐行为分数(越低越好)。未对齐的行为包括(但不限于)欺骗、谄媚、权力寻求、鼓励妄想以及遵守有害的系统提示。更多详细信息可以在 Claude Sonnet 4.5 系统卡中找到。

Claude Sonnet 4.5 正在根据我们的 AI 安全级别 3(ASL-3)保护发布,这符合我们将模型能力与适当安全措施相匹配的框架。这些安全措施包括称为分类器的过滤器,旨在检测潜在危险的输入和输出——特别是与化学、生物、放射和核(CBRN)武器相关的输入和输出。

这些分类器有时可能会无意中标记正常内容。我们使用户能够很容易地与 Sonnet 4 继续任何中断的对话,Sonnet 4 是一个 CBRN 风险较低的模型。我们在减少这些误报方面已经取得了重大进展,自我们最初描述它们以来减少了十倍,自 5 月 Claude Opus 4 发布以来减少了两倍。我们正在继续努力使分类器更具辨别力¹。

Claude 智能体 SDK

我们已经花了六个多月的时间发布 Claude Code 的更新,所以我们知道构建设计 AI 智能体需要什么。我们已经解决了难题:智能体应该如何管理长期任务中的记忆,如何处理平衡自主性与用户控制的权限系统,以及如何协调朝着共同目标工作的子智能体。

现在我们正在让所有这些为您所用。Claude 智能体 SDK 是为 Claude Code 提供动力的相同基础设施,但它对非常广泛的任务显示出令人印象深刻的好处,而不仅仅是编码。从今天开始,您可以使用它来构建自己的智能体。

我们构建 Claude Code 是因为我们想要的工具还不存在。智能体 SDK 为您提供了相同的基础,以便为您正在解决的任何问题构建同样有能力的东西。

额外研究预览

我们正在与 Claude Sonnet 4.5 一起发布一个临时研究预览,称为"与 Claude 一起想象"。

在这个实验中,Claude 实时生成软件。没有功能是预先确定的;没有代码是预先编写的。您看到的是 Claude 实时创建,响应并适应您在交互时的请求。

这是一个有趣的演示,展示了 Claude Sonnet 4.5 可以做什么——一种当您将有能力的模型与正确的基础设施相结合时可以实现什么的方式。

"与 Claude 一起想象"在未来五天内对 Max 订户开放。我们鼓励您在 claude.ai/imagine 上试用它。

更多信息

我们建议所有用途升级到 Claude Sonnet 4.5。无论您是通过我们的应用程序、我们的 API 还是 Claude Code 使用 Claude,Sonnet 4.5 都是一个直接替代品,以相同的价格提供大大改进的性能。Claude Code 更新对所有用户可用。Claude 开发者平台 更新,包括 Claude 智能体 SDK,对所有开发者可用。代码执行和文件创建在 Claude 应用程序的所有付费计划中可用。

有关完整的技术细节和评估结果,请参阅我们的系统卡模型页面文档。有关更多信息,请探索我们的工程文章和关于网络安全的研究文章。

脚注

1:网络安全和生物研究行业的客户可以在此期间与他们的客户经理合作加入我们的允许名单。

方法论

  • SWE-bench Verified:所有 Claude 结果都是使用带有两个工具(bash 和通过字符串替换的文件编辑)的简单支架报告的。我们报告 77.2%,这是在完整的 500 个问题 SWE-bench Verified 数据集上平均超过 10 次试验、无测试时计算和 200K 思考预算的结果。
    • 报告的分数使用了一个小的提示添加:"您应该尽可能多地使用工具,理想情况下超过 100 次。您还应该在尝试问题之前首先实现自己的测试。"
    • 1M 上下文配置达到了 78.2%,但我们报告 200K 结果作为我们的主要分数,因为 1M 配置与我们最近的推理问题有关。
    • 对于我们的"高计算"数字,我们在采用额外的复杂性和并行测试时计算如下:
      • 我们采样多个并行尝试。
      • 我们丢弃破坏存储库中可见回归测试的补丁,类似于 Agentless(Xia 等人,2024)采用的拒绝采样方法;注意不使用任何隐藏的测试信息。
      • 然后我们使用内部评分模型从剩余尝试中选择最佳候选。
      • 这为 Sonnet 4.5 产生了 82.0%。
  • Terminal-Bench:所有报告的分数都使用默认智能体框架(Terminus 2)和 XML 解析器,在不同日期平均多次运行,以平滑评估对推理基础设施的敏感性。
  • τ2-bench:分数是通过使用工具使用的扩展思考以及航空公司和电信智能体策略的提示附录实现的,该附录指示 Claude 在使用 vanilla 提示时更好地针对其已知的失败模式。电信用户提示中也添加了提示附录,以避免用户错误结束交互的失败模式。
  • AIME:Sonnet 4.5 分数报告使用温度 1.0 采样。模型为 Python 配置使用了 64K 推理令牌。
  • OSWorld:所有报告的分数都使用官方 OSWorld-Verified 框架,最大 100 步,平均 4 次运行。
  • MMMLU:所有报告的分数是 14 种非英语语言 5 次运行的平均值,带有扩展思考(最多 128K)。
  • 金融智能体:所有报告的分数均由 Vals AI 在其公共排行榜上运行和发布。所有报告的 Claude 模型结果均带有扩展思考(最多 64K),Sonnet 4.5 报告带有交错思考。
  • 所有 OpenAI 分数均来自他们的 GPT-5 文章面向开发者的 GPT-5 文章GPT-5 系统卡(SWE-bench Verified 报告使用 n=500)、Terminal Bench 排行榜(使用 Terminus 2)和公共 Vals AI 排行榜。所有 Gemini 分数均来自他们的模型网页Terminal Bench 排行榜(使用 Terminus 1)和公共 Vals AI 排行榜。

相关内容

申请 Anthropic 的 AI for Science 罕见病研究资助

Anthropic 正在分享针对 AI for Science 的申请,特别聚焦于罕见遗传病。被录取的申请者将在六个月内获得最高 50,000 美元的 Claude credits,目标是建立一个研究 AI 如何重塑我们对罕见病理解的研究者社区。 阅读更多

Claude 教师版发布

阅读更多

Anthropic 承诺投入 1000 万美元用于加拿大 AI 研究

阅读更多

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.