扩展阅读

推出 Computer Use、新版 Claude 3.5 Sonnet 和 Claude 3.5 Haiku

Anthropic·2026/7/21·7 阅读

推出 Computer Use、新版 Claude 3.5 Sonnet 和 Claude 3.5 Haiku \ Anthropic

来源: https://www.anthropic.com/news/3-5-models-and-computer-use 抓取时间: 2026-07-21 16:25:02


公告

推出 Computer Use、新版 Claude 3.5 Sonnet 和 Claude 3.5 Haiku

Oct 22, 2024 Claude 操作电脑光标的插图 更新(2024年12月3日):我们修改了 Claude 3.5 Haiku 的定价。该模型现在的价格为每百万输入令牌 0.80 美元 / 每百万输出令牌 4 美元。

今天,我们宣布推出升级版 Claude 3.5 Sonnet和一个新模型 Claude 3.5 Haiku。升级版 Claude 3.5 Sonnet 与其前代产品相比全面提升,在编码领域取得了特别显著的进步——它在该领域已经处于领先地位。Claude 3.5 Haiku 在许多评估上与我们之前最大的模型 Claude 3 Opus 性能相当,速度与上一代 Haiku 相似。

我们还推出了一项突破性的新功能,目前处于公开测试阶段:Computer Use。从今天起,开发者可以通过 API 使用该功能,指示 Claude 像人类一样使用计算机——通过查看屏幕、移动光标、点击按钮和输入文本。Claude 3.5 Sonnet 是首个提供公开测试版 Computer Use 的前沿 AI 模型。在这个阶段,它仍然是实验性的——有时会很繁琐且容易出错。我们提前发布 Computer Use 以获取开发者的反馈,并期望该能力能够随着时间的推移迅速改进。

Asana、Canva、Cognition、DoorDash、Replit 和 The Browser Company 已经开始探索这些可能性,执行需要几十步,有时甚至几百步才能完成的任务。例如,Replit 正在使用 Claude 3.5 Sonnet 的 Computer Use 和 UI 导航能力,为其 Replit Agent 产品开发一项在应用构建时对其进行评估的关键功能。

升级版 Claude 3.5 Sonnet 现已对所有用户可用。从今天起,开发者可以在 Anthropic API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上使用 Computer Use 测试版进行构建。新的 Claude 3.5 Haiku 将于本月晚些时候发布。

Claude 3.5 Sonnet:行业领先的软件工程技能

更新后的 Claude 3.5 Sonnet 在行业基准上显示出广泛的改进,在智能体编码和 Tool Use 任务方面取得了特别强劲的进步。在编码方面,它在 SWE-bench Verified 上的性能从 33.4% 提升到 49.0%,得分高于所有公开可用的模型——包括像 OpenAI o1-preview 这样的推理模型和为智能体编码设计的专用系统。它在 TAU-bench(一项智能体 Tool Use 任务)上的性能也在零售领域从 62.6% 提升到 69.2%,在更具挑战性的航空领域从 36.0% 提升到 46.0%。新的 Claude 3.5 Sonnet 以与其前代产品相同的价格和速度提供这些进步。

早期客户反馈表明,升级版 Claude 3.5 Sonnet 代表了 AI 驱动编码的重大飞跃。GitLab 对该模型进行了 DevSecOps 任务测试,发现它提供了更强的推理能力(各用例提升高达 10%),且没有增加延迟,使其成为驱动多步骤软件开发流程的理想选择。Cognition 使用新的 Claude 3.5 Sonnet 进行自主 AI 评估,与之前版本相比,在编码、规划和问题解决方面都有了显著改进。The Browser Company 在使用该模型自动化基于 Web 的工作流时指出,Claude 3.5 Sonnet 优于他们之前测试过的每一个模型。

作为我们与外部专家合作的持续努力的一部分,美国 AI 安全研究所(US AISI)和英国安全研究所(UK AISI)对新的 Claude 3.5 Sonnet 模型进行了部署前联合测试。

我们还评估了升级版 Claude 3.5 Sonnet 的灾难性风险,发现我们的负责任扩展政策中概述的 ASL-2 标准仍然适用于该模型。

Claude 3.5 Haiku:最先进技术与经济性和速度的结合

Claude 3.5 Haiku 是我们最快模型的下一代。在与 Claude 3 Haiku 相似的速度下,Claude 3.5 Haiku 在所有技能组合上都有所改进,并且在许多智能基准上甚至超越了我们上一代最大的模型 Claude 3 Opus。Claude 3.5 Haiku 在编码任务上特别强大。例如,它在 SWE-bench Verified 上得分 40.6%,优于许多使用公开可用的最先进模型的智能体——包括原始 Claude 3.5 Sonnet 和 GPT-4o。

凭借低延迟、改进的指令遵循和更准确的 Tool Use,Claude 3.5 Haiku 非常适合面向用户的产品、专用的子智能体任务,以及从海量数据(如购买历史、定价或库存记录)生成个性化体验。

Claude 3.5 Haiku 将于本月晚些时候在我们的第一方 API、Amazon Bedrock 和 Google Cloud 的 Vertex AI 上发布——最初是纯文本模型,随后将支持图像输入。

负责任地教 Claude 操作计算机

通过 Computer Use,我们正在尝试一些全新的东西。我们不是制作特定的工具来帮助 Claude 完成个别任务,而是教它通用的计算机技能——允许它使用为人类设计的各种标准工具和软件程序。开发者可以使用这一新兴能力来自动化重复流程、构建和测试软件,以及执行像研究这样的开放式任务

为了使这些通用技能成为可能,我们构建了一个 API,允许 Claude 感知并与计算机界面交互。开发者可以集成此 API,使 Claude 能够将指令(例如,"使用我的计算机和在线数据填写此表格")转换为计算机命令(例如,检查电子表格;移动光标打开 Web 浏览器;导航到相关网页;使用这些页面的数据填写表格;等等)。在 OSWorld 上——该基准评估 AI 模型像人类一样使用计算机解决真实世界软件问题的能力——Claude 3.5 Sonnet 在仅截图类别中得分 14.9%,明显优于次优 AI 系统的 7.8% 得分。当给予更多步骤来完成任务时,Claude 得分 22.0%。

虽然我们期望这一能力在未来几个月迅速改进,但 Claude 当前使用计算机的能力并不完美。人类可以轻松执行的一些操作——滚动、拖动、缩放——目前对 Claude 构成挑战,我们鼓励开发者从低风险任务开始探索。由于 Computer Use 可能为更熟悉的威胁(如垃圾邮件、虚假信息或欺诈)提供新的传播途径,我们正在采取主动方法来促进其安全部署。我们开发了新的分类器,可以识别何时在使用 Computer Use 以及是否正在发生危害。您可以在我们关于开发计算机使用的文章中了解更多关于这项新技能背后的研究过程,以及关于安全措施的进一步讨论。

展望未来

从这项仍处于最早阶段的技术的最初部署中学习,将帮助我们更好地理解能力日益增强的 AI 系统的潜力和影响。

我们期待您探索我们的新模型和 Computer Use 的公开测试版——并欢迎您与我们分享您的反馈。我们相信这些发展将为您与 Claude 的合作开辟新的可能性,我们期待看到您将创造什么。

相关内容

申请 Anthropic 的 AI for Science 罕见病研究资助

Anthropic 正在分享针对 AI for Science 申请的特别聚焦于罕见遗传病的信息。被录取的申请者将在六个月内获得最高 50,000 美元的 Claude 积分,目标是建立一个研究 AI 如何重塑我们对罕见病理解的研究人员社区。 阅读更多

推出 Claude for Teachers

阅读更多

Anthropic 承诺投入 1000 万美元用于加拿大 AI 研究

阅读更多

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.