Phase 1 · Agent 基础

构建有效的 AI 智能体

Anthropic·2026/7/21·8 阅读

构建有效的 AI 智能体 \ Anthropic

来源: https://www.anthropic.com/engineering/building-effective-agents 抓取时间: 2026-07-21 16:18:53


在过去一年中,我们与数十个团队合作,跨行业构建大型语言模型(LLM)智能体。最成功的实现始终没有使用复杂框架或专门库。相反,它们使用简单、可组合的模式进行构建。

在这篇文章中,我们分享了从与客户合作和自己构建智能体中学到的经验,并为开发者提供构建有效智能体的实用建议。

什么是智能体?

"智能体"可以通过多种方式定义。一些客户将智能体定义为长期独立运行、使用各种工具完成复杂任务的完全自主系统。其他人使用该术语来描述遵循预定义工作流的更具规范性的实现。在 Anthropic,我们将所有这些变体归类为 智能体系统,但在 工作流智能体 之间划出了重要的架构区别:

  • 工作流 是 LLM 和工具通过预定义代码路径进行编排的系统。
  • 智能体 则是 LLM 动态指导自己的流程和工具使用,保持对如何完成任务的控制的系统。

下面,我们将详细探讨这两种类型的智能体系统。在附录 1("实践中的智能体")中,我们描述了客户在使用这些系统中发现特别价值的两个领域。

何时(以及何时不)使用智能体

在构建 LLM 应用程序时,我们建议找到尽可能简单的解决方案,并且仅在需要时增加复杂性。这可能意味着根本不构建智能体系统。智能体系统通常以延迟和成本为代价换取更好的任务性能,您应该考虑这种权衡何时有意义。

当需要更多复杂性时,工作流为明确定义的任务提供可预测性和一致性,而智能体在需要大规模灵活性和模型驱动决策时是更好的选择。然而,对于许多应用程序,使用检索和上下文内示例优化单个 LLM 调用通常就足够了。

何时以及如何使用框架

有许多框架使智能体系统更容易实现,包括:

这些框架通过简化标准低级任务(如调用 LLM、定义和解析工具以及将调用链接在一起)使入门变得容易。然而,它们通常会创建额外的抽象层,这些抽象层会掩盖底层提示和响应,使调试变得更加困难。它们还可能诱使您在更简单的设置就足够时增加复杂性。

我们建议开发者首先直接使用 LLM API:许多模式可以用几行代码实现。如果您确实使用框架,请确保您理解底层代码。关于底层内容的错误假设是客户错误的常见来源。

请参阅我们的食谱获取一些示例实现。

构建块、工作流和智能体

在本节中,我们将探讨我们在生产中看到的智能体系统的常见模式。我们将从基础构建块——增强型 LLM——开始,逐步增加复杂性,从简单的组合工作流到自主智能体。

构建块:增强型 LLM

智能体系统的基本构建块是通过检索、工具和记忆等增强功能增强的 LLM。我们当前的模型可以主动使用这些能力——生成自己的搜索查询、选择适当的工具,并确定要保留什么信息。

增强型 LLM 增强型 LLM

我们建议专注于实现的两个关键方面:根据您的特定用例定制这些能力,并确保它们为您的 LLM 提供简单、文档完善的接口。虽然有许多方法可以实现这些增强,但一种方法是通过我们最近发布的模型上下文协议,它允许开发者通过简单的客户端实现与不断增长的第三方工具生态系统集成。

在本文的其余部分,我们将假设每个 LLM 调用都可以访问这些增强的能力。

工作流:提示链式

提示链式将任务分解为一系列步骤,其中每个 LLM 调用处理前一个步骤的输出。您可以在任何中间步骤上添加编程检查(参见下图中的"gate"),以确保过程仍在正轨上。

提示链式工作流 提示链式工作流

何时使用此工作流: 此工作流非常适合可以轻松干净地分解为固定子任务的情况。主要目标是通过使每个 LLM 调用成为更简单的任务,以延迟换取更高的准确性。

提示链式有用的示例:

  • 生成营销文案,然后将其翻译成不同的语言。
  • 编写文档大纲,检查大纲满足某些标准,然后根据大纲编写文档。

工作流:路由

路由对输入进行分类并将其定向到专门的后续任务。此工作流允许分离关注点,并构建更专门的提示。如果没有此工作流,优化一种输入可能会损害其他输入的性能。

路由工作流 路由工作流

何时使用此工作流: 路由适用于复杂任务,其中有不同的类别最好单独处理,并且可以通过 LLM 或更传统的分类模型/算法准确处理分类。

路由有用的示例:

  • 将不同类型的客户服务查询(一般问题、退款请求、技术支持)引导到不同的下游流程、提示和工具。
  • 将简单/常见问题路由到更小、成本效益高的模型(如 Claude Haiku 4.5),将困难/不常见问题路由到更强大的模型(如 Claude Sonnet 4.5),以优化最佳性能。

工作流:并行化

LLM 有时可以同时处理任务,并以编程方式聚合其输出。此工作流——并行化——表现为两个关键变体:

  • 分段:将任务分解为并行运行的独立子任务。
  • 投票:多次运行相同任务以获得多样化的输出。

并行化工作流 并行化工作流

何时使用此工作流: 当划分的子任务可以并行化以提高速度,或者当需要多个视角或尝试以获得更高置信度的结果时,并行化是有效的。对于具有多个考虑因素的复杂任务,LLM 在每个考虑因素由单独的 LLM 调用处理时通常表现更好,允许专注于每个特定方面。

并行化有用的示例:

  • 分段
    • 实施护栏,其中一个模型实例处理用户查询,而另一个模型实例筛选不适当的内容或请求。这往往比相同的 LLM 调用同时处理护栏和核心响应表现更好。
    • 自动化评估 LLM 性能,其中每个 LLM 调用评估模型在给定提示下性能的不同方面。
  • 投票
    • 审查代码漏洞,其中几个不同的提示审查代码并在发现问题时标记代码。
    • 评估给定内容是否不适当,使用多个提示评估不同方面或要求不同的投票阈值以平衡误报和漏报。

工作流:编排器-工作器

在编排器-工作器工作流中,中央 LLM 动态分解任务,将它们委托给工作器 LLM,并综合它们的结果。

编排器-工作器工作流 编排器-工作器工作流

何时使用此工作流: 此工作流非常适合无法预测所需子任务的复杂任务(例如,在编码中,需要更改的文件数量和每个文件中更改的性质可能取决于任务)。虽然它在拓扑上相似,但与并行化的关键区别在于其灵活性——子任务不是预定义的,而是由编排器根据特定输入确定的。

编排器-工作器有用的示例:

  • 每次对多个文件进行复杂更改的编码产品。
  • 涉及从多个来源收集和分析信息以寻找可能相关信息的搜索任务。

工作流:评估器-优化器

在评估器-优化器工作流中,一个 LLM 调用生成响应,而另一个在循环中提供评估和反馈。

评估器-优化器工作流 评估器-优化器工作流

何时使用此工作流: 当我们有明确的评估标准,并且迭代细化提供可衡量的价值时,此工作流特别有效。两个良好的适用迹象是:首先,当人类表达他们的反馈时,LLM 响应可以得到明显改进;其次,LLM 可以提供此类反馈。这类似于人类作家在撰写精修文档时可能经历的迭代写作过程。

评估器-优化器有用的示例:

  • 文学翻译,其中翻译 LLM 可能最初没有捕捉到细微差别,但评估器 LLM 可以提供有用的批评。
  • 需要多轮搜索和分析以收集全面信息的复杂搜索任务,其中评估器决定是否需要进一步搜索。

智能体

随着 LLM 在关键能力——理解复杂输入、参与推理和规划、可靠使用工具以及从错误中恢复——方面的成熟,智能体正在生产中出现。智能体从人类用户的命令或交互式讨论开始其工作。一旦任务明确,智能体就会独立规划和操作,可能会返回给人类以获取进一步信息或判断。在执行期间,智能体在每个步骤从环境中获得"地面真理"(例如工具调用结果或代码执行)以评估其进展至关重要。然后,智能体可以在检查点或遇到障碍时暂停以获取人类反馈。任务通常在完成时终止,但也常见于包含停止条件(例如最大迭代次数)以保持控制。

智能体可以处理复杂的任务,但它们的实现通常很简单。它们通常只是 LLM 在循环中基于环境反馈使用工具。因此,清晰、周到地设计工具集及其文档至关重要。我们在附录 2("对您的工具进行提示工程")中详细阐述了工具开发的最佳实践。

自主智能体 自主智能体

何时使用智能体: 智能体可用于开放式问题,在这些问题中,很难或不可能预测所需的步骤数,并且您无法硬编码固定路径。LLM 可能会运行多轮,并且您必须对其决策有一定程度的信任。智能体的自主性使它们成为在可信环境中扩展任务的理想选择。

智能体的自主性质意味着更高的成本,以及错误累积的可能性。我们建议在沙箱环境中进行广泛测试,以及适当的护栏。

智能体有用的示例: 以下示例来自我们自己的实现:

编码智能体的高层流程 编码智能体的高层流程

组合和定制这些模式

这些构建块不是规范性的。它们是开发者可以塑造和组合以适应不同用例的常见模式。与任何 LLM 功能一样,成功的关键是衡量性能并迭代实现。重复一遍:您应该 在复杂性确实能改善结果时才考虑增加复杂性。

总结

LLM 领域的成功不是关于构建最复杂的系统,而是关于构建满足您需求的 正确 系统。从简单的提示开始,通过全面评估优化它们,并且仅当更简单的解决方案不足时才添加多步智能体系统。

在实现智能体时,我们尝试遵循三个核心原则:

  1. 保持智能体设计的 简单性
  2. 通过明确显示智能体的规划步骤来优先考虑 透明度
  3. 通过彻底的工具 文档和测试 精心设计您的智能体-计算机接口(ACI)。

框架可以帮助您快速入门,但不要犹豫减少抽象层并在转向生产时使用基本组件进行构建。通过遵循这些原则,您可以创建不仅强大而且可靠、可维护且受用户信任的智能体。

致谢

由 Erik S. 和 Barry Zhang 撰写。这项工作借鉴了我们在 Anthropic 构建智能体的经验以及我们客户分享的宝贵见解,对此我们深表感激。

附录 1:实践中的智能体

我们与客户的合作揭示了 AI 智能体的两个特别有前景的应用,它们展示了上述模式的实际价值。这两个应用都说明了智能体如何为需要对话和行动、具有明确成功标准、启用反馈循环并集成有意义的人类监督的任务增加最大价值。

A. 客户支持

客户支持将熟悉的聊天机器人界面与通过工具集成增强的能力相结合。这自然适用于更开放的智能体,因为:

  • 支持交互自然遵循对话流程,同时需要访问外部信息和行动;
  • 可以集成工具来提取客户数据、订单历史和知识库文章;
  • 可以通过编程方式处理诸如发布退款或更新工单之类的行动;并且
  • 可以通过用户定义的解决方案清晰地衡量成功。

几家公司已经通过基于使用的定价模型证明了这种方法的可行性,该模型仅对成功的解决方案收费,显示了对其智能体有效性的信心。

B. 编码智能体

软件开发领域已显示出 LLM 功能的显著潜力,能力从代码完成发展到自主问题解决。智能体特别有效,因为:

  • 代码解决方案可以通过自动化测试验证;
  • 智能体可以使用测试结果作为反馈来迭代解决方案;
  • 问题空间定义明确且结构化;并且
  • 可以客观地衡量输出质量。

在我们自己的实现中,智能体现在可以仅基于拉取请求描述解决 SWE-bench Verified 基准中的真实 GitHub 问题。然而,虽然自动化测试有助于验证功能,但人工审查对于确保解决方案符合更广泛的系统要求仍然至关重要。

附录 2:对您的工具进行提示工程

无论您正在构建哪种智能体系统,工具都可能是您智能体的重要组成部分。工具通过在我们的 API 中指定其确切结构和定义,使 Claude 能够与外部服务和 API 交互。当 Claude 响应时,如果它计划调用工具,它将在 API 响应中包含一个工具使用块。工具定义和规范应该与您的整体提示一样,获得同等的提示工程关注。在这个简短的附录中,我们描述了如何对您的工具进行提示工程。

通常有几种方法可以指定相同的行动。例如,您可以通过编写差异或通过重写整个文件来指定文件编辑。对于结构化输出,您可以在 Markdown 内或 JSON 内返回代码。在软件工程中,这些差异是表面的,可以从一种无损地转换到另一种。然而,某些格式对于 LLM 来说比其他格式要困难得多。编写差异需要在编写新代码之前知道块头中有多少行在变化。在 JSON 中编写代码(与 Markdown 相比)需要额外的换行符和引号转义。

我们对决定工具格式的建议如下:

  • 给模型足够的令牌来"思考",然后再把自己逼到角落里。
  • 保持格式接近模型在互联网文本中自然看到的内容。
  • 确保没有格式"开销",例如必须准确计数数千行代码,或者对其编写的任何代码进行字符串转义。

一个经验法则是思考人机交互(HCI)需要多少努力,并计划在创建好的 智能体 -计算机接口(ACI)方面投入同样多的努力。以下是一些关于如何做到这一点的想法:

  • 设身处地为模型着想。根据描述和参数,使用这个工具是否明显,或者您是否需要仔细考虑?如果是这样,那么模型可能也是如此。一个好的工具定义通常包括示例用法、边缘情况、输入格式要求以及与其他工具的明确边界。
  • 您如何更改参数名称或描述以使事情更明显?把这看作是为您团队中的初级开发人员编写一个好的文档字符串。当使用许多类似工具时,这一点尤其重要。
  • 测试模型如何使用您的工具:在我们的工作平台中运行许多示例输入,看看模型会犯什么错误,然后迭代。
  • 防错您的工具。更改参数,使犯错误更难。

在为 SWE-bench 构建我们的智能体时,我们实际上花在优化工具上的时间比花在整体提示上的时间更多。例如,我们发现,在智能体移出根目录后,模型会在使用相对文件路径的工具时犯错误。为了解决这个问题,我们更改了工具,使其始终需要绝对文件路径——并且我们发现模型完美地使用了这种方法。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.