我们如何构建多智能体研究系统 \ Anthropic
来源: https://www.anthropic.com/engineering/multi-agent-research-system 抓取时间: 2026-07-21 16:25:07
Claude 现在拥有研究能力,允许它在网络、Google Workspace 和任何集成中搜索以完成复杂任务。
这个多智能体系统从原型到生产的旅程教会了我们关于系统架构、工具设计和提示词工程的关键经验。多智能体系统由多个智能体(在循环中自主使用工具的 LLM)协同工作组成。我们的研究功能涉及一个智能体,它根据用户查询规划研究过程,然后使用工具创建并行智能体来同时搜索信息。具有多个智能体的系统在智能体协调、评估和可靠性方面带来了新的挑战。
本文详细介绍了对我们有效的原则——我们希望您在构建自己的多智能体系统时能发现它们有用。
多智能体系统的优势
研究工作涉及开放式问题,很难提前预测所需的步骤。您不能硬编码探索复杂主题的固定路径,因为该过程本质上是动态的且路径依赖的。当人们进行研究时,他们倾向于根据发现不断更新他们的方法,追踪调查过程中出现的线索。
这种不可预测性使 AI 智能体特别适合研究任务。研究需要灵活性,以便在调查展开时转向或探索切线连接。模型必须自主运行多轮,根据中间发现决定追求哪些方向。线性的一次性管道无法处理这些任务。
搜索的本质是压缩:从庞大的语料库中提炼见解。子智能体通过在自己的上下文窗口中并行运行,同时探索问题的不同方面,然后为首席研究智能体浓缩最重要的令牌,从而促进压缩。每个子智能体还提供关注点分离——不同的工具、提示词和探索轨迹——这减少了路径依赖性,并实现了彻底、独立的调查。
一旦智能达到阈值,多智能体系统就成为扩展性能的重要方式。例如,尽管在过去 10 万年中人类个体变得更加智能,但在信息时代,由于我们的集体智能和协调能力,人类社会的能力呈指数级增长。即使是通用智能的智能体作为个体运作也面临限制;智能体群体可以完成更多任务。
我们的内部评估表明,多智能体研究系统特别擅长涉及同时追求多个独立方向的广度优先查询。我们发现,以 Claude Opus 4 为首席智能体和 Claude Sonnet 4 子智能体的多智能体系统在我们的内部研究评估中比单智能体 Claude Opus 4 表现好 90.2%。例如,当被要求识别信息技术标准普尔 500 指数中公司的所有董事会成员时,多智能体系统通过将其分解为子智能体的任务找到了正确答案,而单智能体系统通过缓慢的顺序搜索未能找到答案。
多智能体系统之所以有效,主要是因为它们帮助消耗足够的令牌来解决问题。在我们的分析中,三个因素解释了 BrowseComp 评估(测试浏览智能体定位难以找到的信息的能力)中 95% 的性能差异。我们发现,令牌使用本身解释了 80% 的差异,工具调用次数和模型选择是另外两个解释因素。这一发现验证了我们的架构,该架构通过具有独立上下文窗口的智能体分配工作,以增加并行推理的容量。最新的 Claude 模型在令牌使用方面充当了巨大的效率乘数,因为升级到 Claude Sonnet 4 比将 Claude Sonnet 3.7 的令牌预算加倍带来的性能增益更大。多智能体架构有效地扩展了超出单个智能体限制的任务的令牌使用。
有一个缺点:在实践中,这些架构快速消耗令牌。在我们的数据中,智能体通常使用比聊天交互多约 4 倍的令牌,而多智能体系统使用比聊天多约 15 倍的令牌。为了经济可行性,多智能体系统需要任务价值足够高以支付性能提升的任务。此外,一些要求所有智能体共享相同上下文或涉及智能体之间许多依赖关系的领域目前不适合多智能体系统。例如,大多数编码任务涉及的真正可并行化任务比研究少,并且 LLM 智能体还不擅长实时协调和委派给其他智能体。我们发现,多智能体系统擅长涉及大量并行化、超出单上下文窗口的信息以及与众多复杂工具交互的有价值任务。
研究系统的架构概述
我们的研究系统使用具有编排器-工作者模式的多智能体架构,其中首席智能体协调流程,同时委派给并行运行的专用子智能体。
多智能体架构的实际运行:用户查询流经首席智能体,后者创建专用子智能体来并行搜索不同方面。
当用户提交查询时,首席智能体分析它,制定策略,并生成子智能体来同时探索不同方面。如上图所示,子智能体充当智能过滤器,通过迭代使用搜索工具收集信息,在这种情况下是关于 2025 年的 AI 智能体公司,然后将公司列表返回给首席智能体,以便它可以汇编最终答案。
使用检索增强生成(RAG)的传统方法使用静态检索。也就是说,它们获取与输入查询最相似的一些块,并使用这些块生成响应。相比之下,我们的架构使用多步搜索,动态查找相关信息,适应新发现,并分析结果以制定高质量的答案。
显示我们的多智能体研究系统完整工作流的流程图。当用户提交查询时,系统创建一个 LeadResearcher 智能体,该智能体进入迭代研究过程。LeadResearcher 首先思考方法并将其计划保存到内存中以保留上下文,因为如果上下文窗口超过 200,000 个令牌,它将被截断,因此保留计划很重要。然后它创建具有特定研究任务的专用子智能体(此处显示了两个,但可以是任意数量)。每个子智能体独立执行网络搜索,使用交错思考评估工具结果,并将发现返回给 LeadResearcher。LeadResearcher 综合这些结果并决定是否需要更多研究——如果需要,它可以创建额外的子智能体或改进其策略。一旦收集到足够的信息,系统退出研究循环并将所有发现传递给 CitationAgent,后者处理文档和研究报告以识别引用的特定位置。这确保所有声明都正确归因于其来源。然后,完整的最终研究结果将返回给用户。
研究智能体的提示词工程和评估
多智能体系统与单智能体系统有关键区别,包括协调复杂性的快速增长。早期智能体犯了错误,例如为简单查询生成 50 个子智能体,无休止地搜索不存在的来源,以及通过过度更新分散彼此的注意力。由于每个智能体都由提示词引导,提示词工程是我们改善这些行为的主要手段。以下是我们学到的一些提示智能体的原则:
- 像你的智能体一样思考。 为了迭代提示词,你必须理解它们的效果。为了帮助我们做到这一点,我们使用我们的控制台构建了模拟,使用系统中的确切提示词和工具,然后观察智能体一步步工作。这立即揭示了失败模式:智能体在已经有足够结果时继续,使用过于冗长的搜索查询,或选择不正确的工具。有效的提示依赖于开发智能体的准确心理模型,这可以使最有影响力的变化变得明显。
- 教编排器如何委派。 在我们的系统中,首席智能体将查询分解为子任务并向子智能体描述它们。每个子智能体需要一个目标、输出格式、关于使用的工具和来源的指导,以及清晰的任务边界。如果没有详细的任务描述,智能体会重复工作,留下漏洞,或未能找到必要的信息。我们开始时允许首席智能体给出简单、简短的指令,如"研究半导体短缺",但发现这些指令通常足够模糊,以至于子智能体误解任务或执行与其他智能体完全相同的搜索。例如,一个子智能体探索了 2021 年汽车芯片危机,而另外两个智能体则重复工作调查当前 2025 年的供应链,没有有效的劳动分工。
- 根据查询复杂性扩展工作。 智能体难以判断不同任务的适当工作,因此我们在提示词中嵌入了扩展规则。简单的事实调查只需要 1 个智能体,进行 3-10 次工具调用,直接比较可能需要 2-4 个子智能体,每个进行 10-15 次调用,而复杂研究可能使用超过 10 个具有明确分工的子智能体。这些明确的指导方针帮助首席智能体高效分配资源,并防止在简单查询上过度投资,这是我们早期版本中的常见失败模式。
- 工具设计和选择至关重要。 智能体-工具接口与人机接口一样关键。使用正确的工具是高效的——通常,这是绝对必要的。例如,一个智能体在网络上搜索只存在于 Slack 中的上下文从一开始就注定失败。通过MCP 服务器赋予模型访问外部工具的权限,这个问题变得更加复杂,因为智能体遇到了描述质量差异巨大的未见工具。我们给智能体明确的启发式方法:例如,首先检查所有可用工具,将工具使用与用户意图匹配,搜索网络进行广泛的外部探索,或更喜欢专用工具而不是通用工具。糟糕的工具描述可能会将智能体发送到完全错误的路径,因此每个工具都需要独特的目的和清晰的描述。
- 让智能体自我改进。 我们发现 Claude 4 模型可以成为优秀的提示词工程师。当给定提示词和失败模式时,它们能够诊断智能体失败的原因并提出改进建议。我们甚至创建了一个工具测试智能体——当给定一个有缺陷的 MCP 工具时,它尝试使用该工具,然后重写工具描述以避免失败。通过测试该工具数十次,这个智能体发现了关键的细微差别和错误。这个改进工具人体工程学的过程使使用新描述的未来智能体的任务完成时间减少了 40%,因为它们能够避免大多数错误。
- 从广泛开始,然后缩小范围。 搜索策略应反映专家人类研究:在深入细节之前探索格局。智能体通常默认使用过长、过于具体的查询,返回的结果很少。我们通过提示智能体从简短、广泛的查询开始,评估可用的内容,然后逐步缩小焦点来抵消这种倾向。
- 引导思考过程。 扩展思考模式引导 Claude 在可见的思考过程中输出额外的令牌,可以作为可控的暂存器。首席智能体使用思考来规划其方法,评估哪些工具适合任务,确定查询复杂性和子智能体数量,并定义每个子智能体的角色。我们的测试表明,扩展思考改进了指令遵循、推理和效率。子智能体也进行规划,然后在工具结果后使用交错思考来评估质量,识别差距,并改进他们的下一个查询。这使子智能体在适应任何任务时更有效。
- 并行工具调用改变了速度和性能。 复杂的研究任务自然涉及探索许多来源。我们的早期智能体执行顺序搜索,这慢得令人痛苦。为了提高速度,我们引入了两种并行化:(1)首席智能体并行而不是串行启动 3-5 个子智能体;(2)子智能体并行使用 3+ 工具。这些变化将复杂查询的研究时间减少了多达 90%,使 Research 能够在几分钟内而不是几小时内完成更多工作,同时覆盖比其他系统更多的信息。
我们的提示策略侧重于灌输良好的启发式方法,而不是僵化的规则。我们研究了熟练的人类如何处理研究任务,并将这些策略编码到我们的提示词中——例如将困难的问题分解为更小的任务,仔细评估来源质量,根据新信息调整搜索方法,以及识别何时专注于深度(详细调查一个主题)与广度(并行探索许多主题)。我们还通过设置明确的护栏来主动减轻意外的副作用,以防止智能体失控。最后,我们专注于具有可观测性和测试用例的快速迭代循环。
智能体的有效评估
良好的评估对于构建可靠的 AI 应用至关重要,智能体也不例外。然而,评估多智能体系统带来了独特的挑战。传统评估通常假设 AI 每次都遵循相同的步骤:给定输入 X,系统应遵循路径 Y 以产生输出 Z。但多智能体系统不是这样工作的。即使起点相同,智能体也可能采取完全不同的有效路径来达到目标。一个智能体可能搜索三个来源,而另一个搜索十个,或者它们可能使用不同的工具来找到相同的答案。因为我们并不总是知道正确的步骤是什么,我们通常不能只检查智能体是否遵循了我们预先规定的"正确"步骤。相反,我们需要灵活的评估方法,判断智能体是否实现了正确的结果,同时也遵循了合理的过程。 立即开始使用小样本进行评估。 在智能体开发早期,变化往往具有戏剧性的影响,因为有大量容易实现的成果。一个提示词调整可能会将成功率从 30% 提高到 80%。在这么大的效果规模下,你只需几个测试用例就能发现变化。我们从大约 20 个代表实际使用模式的查询开始。测试这些查询通常使我们能够清楚地看到变化的影响。我们经常听到 AI 开发团队推迟创建评估,因为他们认为只有数百个测试用例的大型评估才有用。然而,最好立即开始小规模测试,使用几个示例,而不是推迟直到你可以构建更全面的评估。 LLM 作为裁判的评估在做得好时可以扩展。 研究输出很难通过编程方式评估,因为它们是自由格式的文本,很少有单一正确答案。LLM 自然适合评估输出。我们使用了一个 LLM 裁判,根据评分标准中的标准评估每个输出:事实准确性(声明是否与来源匹配?),引用准确性(引用的来源是否与声明匹配?),完整性(是否涵盖了所有要求的方面?),来源质量(它是否使用了主要来源而不是质量较低的次要来源?),以及工具效率(它是否以合理的次数使用了正确的工具?)。我们尝试使用多个裁判来评估每个组件,但发现单次 LLM 调用使用单个提示词输出 0.0-1.0 的分数和通过-失败等级是最一致的,并且与人类判断一致。当评估测试用例确实有明确答案时,这种方法特别有效,我们可以使用 LLM 裁判简单地检查答案是否正确(即它是否准确地列出了前 3 大研发预算最大的制药公司?)。使用 LLM 作为裁判使我们能够可扩展地评估数百个输出。 人类评估捕捉自动化遗漏的内容。 测试智能体的人员发现了评估遗漏的边缘情况。这些包括对不寻常查询的幻觉答案、系统故障或微妙的来源选择偏差。在我们的案例中,人类测试人员注意到我们的早期智能体一致选择 SEO 优化的内容农场,而不是权威但排名较低的来源,如学术 PDF 或个人博客。在我们的提示词中添加来源质量启发式方法帮助解决了这个问题。即使在自动化评估的世界中,手动测试仍然是必不可少的。
多智能体系统具有涌现行为,这些行为在没有特定编程的情况下出现。例如,对首席智能体的小变化可能会不可预测地改变子智能体的行为方式。成功需要理解交互模式,而不仅仅是单个智能体的行为。因此,这些智能体的最佳提示词不仅是严格的指令,而且是定义分工、问题解决方法和工作预算的协作框架。要做到这一点,依赖于仔细的提示词和工具设计、坚实的启发式方法、可观测性和紧密的反馈循环。请参阅我们的Cookbook 中的开源提示词获取我们系统中的示例提示词。
生产可靠性和工程挑战
在传统软件中,错误可能会破坏功能、降低性能或导致中断。在智能体系统中,小的变化会级联成大的行为变化,这使得为必须在长期运行过程中维护状态的复杂智能体编写代码变得非常困难。 智能体是有状态的,错误会累积。 智能体可以长时间运行,在许多工具调用中维护状态。这意味着我们需要持久地执行代码并沿途处理错误。如果没有有效的缓解措施,轻微的系统故障对智能体来说可能是灾难性的。当错误发生时,我们不能只是从头重新开始:重新开始对用户来说既昂贵又令人沮丧。相反,我们构建了可以从智能体发生错误时的位置恢复的系统。我们还使用模型的智能来优雅地处理问题:例如,让智能体知道工具何时出现故障并让它适应,效果出奇地好。我们将基于 Claude 的 AI 智能体的适应性与确定性的安全措施(如重试逻辑和定期检查点)相结合。 调试受益于新方法。 智能体做出动态决策,并且即使使用相同的提示词,在运行之间也是非确定性的。这使得调试更加困难。例如,用户会报告智能体"找不到明显的信息",但我们看不到原因。智能体使用了错误的搜索查询吗?选择了糟糕的来源?遇到了工具故障?添加完整的生产追踪使我们能够诊断智能体失败的原因并系统地解决问题。除了标准的可观测性之外,我们还监控智能体决策模式和交互结构——所有这些都不监控单个对话的内容,以维护用户隐私。这种高级别的可观测性帮助我们诊断根本原因,发现意外行为,并修复常见故障。 部署需要仔细协调。 智能体系统是高度有状态的提示词、工具和执行逻辑网络,几乎连续运行。这意味着每当我们部署更新时,智能体可能处于其过程中的任何位置。因此,我们需要防止我们善意的代码更改破坏现有智能体。我们不能同时将每个智能体更新到新版本。相反,我们使用彩虹部署来避免中断运行的智能体,通过逐渐将流量从旧版本转移到新版本,同时保持两者同时运行。 同步执行会产生瓶颈。 目前,我们的首席智能体同步执行子智能体,等待每组子智能体完成后再继续。这简化了协调,但会在智能体之间的信息流中产生瓶颈。例如,首席智能体不能指导子智能体,子智能体不能协调,并且整个系统可能在等待单个子智能体完成搜索时被阻塞。异步执行将实现额外的并行性:智能体并发工作并在需要时创建新的子智能体。但这种异步性在结果协调、状态一致性和子智能体之间的错误传播方面增加了挑战。随着模型可以处理更长和更复杂的研究任务,我们预计性能增益将证明复杂性是合理的。
结论
在构建 AI 智能体时,最后一英里通常成为旅程的大部分。在开发人员机器上工作的代码库需要大量工程才能成为可靠的生产系统。智能体系统中错误的复合性质意味着传统软件的小问题可能会完全使智能体脱轨。一个步骤的失败可能导致智能体探索完全不同的轨迹,导致不可预测的结果。由于本文中描述的所有原因,原型和生产之间的差距通常比预期的要宽。
尽管存在这些挑战,多智能体系统已被证明对开放式研究任务有价值。用户表示,Claude 帮助他们找到了他们未曾考虑过的商业机会,导航复杂的医疗保健选项,解决棘手的技术错误,并通过发现他们自己无法找到的研究联系节省了多达数天的工作。通过仔细的工程、全面的测试、注重细节的提示词和工具设计、强大的操作实践,以及研究、产品和工程团队之间的密切合作(他们对当前智能体能力有深入的了解),多智能体研究系统可以大规模可靠运行。我们已经看到这些系统正在改变人们解决复杂问题的方式。
Clio嵌入图显示了人们当今使用研究功能的最常见方式。顶级用例类别是跨专业领域开发软件系统(10%),开发和优化专业和技术内容(8%),制定业务增长和创收策略(8%),协助学术研究和教育材料开发(7%),以及研究和验证有关人员、地点或组织的信息(5%)。
致谢
作者:Jeremy Hadfield、Barry Zhang、Kenneth Lien、Florian Scholz、Jeremy Fox 和 Daniel Ford。这项工作反映了 Anthropic 多个团队的集体努力,他们使研究功能成为可能。特别感谢 Anthropic 应用工程团队,他们的奉献精神将这个复杂的多智能体系统带到了生产中。我们也感谢我们的早期用户提供的出色反馈。
附录
以下是一些针对多智能体系统的其他杂项技巧。 对在多轮中改变状态的智能体的最终状态评估。 评估在多轮对话中修改持久状态的智能体带来了独特的挑战。与只读研究任务不同,每个动作都可以改变后续步骤的环境,创建传统评估方法难以处理的依赖关系。我们发现成功的关键是专注于最终状态评估,而不是逐轮分析。不要判断智能体是否遵循了特定过程,而是评估它是否实现了正确的最终状态。这种方法承认,智能体可能会找到通往同一目标的替代路径,同时仍然确保它们提供预期的结果。对于复杂的工作流,将评估分解为离散的检查点,在这些检查点应该发生特定的状态变化,而不是尝试验证每个中间步骤。 长期对话管理。 生产智能体经常参与跨越数百轮的对话,需要仔细的上下文管理策略。随着对话的扩展,标准上下文窗口变得不足,需要智能压缩和记忆机制。我们实现了一些模式,智能体总结已完成的工作阶段,并在继续新任务之前将基本信息存储在外部记忆中。当接近上下文限制时,智能体可以生成具有干净上下文的新子智能体,同时通过仔细的交接保持连续性。此外,它们可以从记忆中检索存储的上下文(如研究计划),而不是在达到上下文限制时丢失以前的工作。这种分布式方法防止了上下文溢出,同时在扩展交互中保持了对话一致性。 子智能体输出到文件系统以最小化"电话游戏"。 对于某些类型的结果,直接子智能体输出可以绕过主协调器,提高保真度和性能。不必要求子智能体通过首席智能体传达所有内容,而是实现工件系统,其中专用智能体可以创建独立持久化的输出。子智能体调用工具将其工作存储在外部系统中,然后将轻量级引用传递回协调器。这防止了多阶段处理过程中的信息丢失,并减少了通过对话历史复制大型输出的令牌开销。这种模式对于结构化输出(如代码、报告或数据可视化)特别有效,其中子智能体的专用提示词比通过通用协调器过滤产生更好的结果。 __IMAGE_0__想了解更多?探索课程