Phase 1 · Agent 基础

构建 Agent 的新工具 | OpenAI

OpenAI·2026/7/21·7 阅读

构建 Agent 的新工具 | OpenAI

来源: https://openai.com/index/new-tools-for-building-agents/ 抓取时间: 2026-07-21 16:18:54


2025年3月11日 产品

构建 Agent 的新工具

在 Playground 中尝试(在新窗口中打开) 一个时尚、简约的界面,显示 AI Agent 的任务列表,包括"triage_agent"、"guardrail"和"update_salesforce_record",背景是流畅的蓝色抽象背景。 Responses API 简介

  • Responses API 简介

  • 这对现有 API 意味着什么

  • Responses API 中的内置工具简介

  • 网络搜索

  • 文件搜索

  • 计算机使用

  • Agents SDK

  • 下一步:构建 Agent 平台

  • Responses API 简介

  • 这对现有 API 意味着什么

  • Responses API 中的内置工具简介

  • 网络搜索

  • 文件搜索

  • 计算机使用

  • Agents SDK

  • 下一步:构建 Agent 平台

今天,我们发布了第一组构建块,帮助开发人员和企业构建有用且可靠的 Agent。我们将 Agent 视为代表用户独立完成任务的系统。在过去一年中,我们引入了新的模型能力——如高级推理、多模态交互和新的安全技术——这些为我们的模型处理构建 Agent 所需的复杂多步骤任务奠定了基础。然而,客户反馈说,将这些能力转化为生产就绪的 Agent 可能具有挑战性,通常需要大量的提示迭代和自定义编排逻辑,而缺乏足够的可见性或内置支持。 为应对这些挑战,我们推出了一套新的 API 和工具,专门设计用于简化 Agentic 应用程序的开发:

这些新工具简化了核心 Agent 逻辑、编排和交互,使开发人员能够更轻松地开始构建 Agent。在未来几周和几个月内,我们计划发布额外的工具和能力,以进一步简化和加速在我们平台上构建 Agentic 应用程序。

Responses API 简介

Responses API 是我们用于利用 OpenAI 内置工具构建 Agent 的新 API 原语。它将 Chat Completions 的简洁性与 Assistants API 的工具使用能力相结合。随着模型能力的不断发展,我们相信 Responses API 将为构建 Agentic 应用程序的开发人员提供更灵活的基础。通过一次 Responses API 调用,开发人员将能够使用多个工具和模型轮次解决日益复杂的任务。 首先,Responses API 将支持新的内置工具,如网络搜索、文件搜索和计算机使用。这些工具旨在协同工作,将模型连接到现实世界,使它们在完成任务时更有用。它还带来了多项可用性改进,包括统一的基于项目的设计、更简单的多态性、直观的流式传输事件以及 SDK 帮助程序(如 response.output_text),以便轻松访问模型的文本输出。 Responses API 专为希望轻松将 OpenAI 模型和内置工具组合到其应用程序中的开发人员而设计,无需集成多个 API 或外部供应商的复杂性。该 API 还使在 OpenAI 上存储数据变得更容易,以便开发人员可以使用追踪和评估等功能评估 Agent 性能。提醒一下,我们默认情况下 不训练 我们的模型使用业务数据,即使数据存储在 OpenAI 上也是如此。该 API 从今天开始对所有开发人员可用,不单独收费——token 和工具按我们的 定价页面 ⁠(在新窗口中打开) 上指定的标准费率计费。查看 Responses API 快速入门指南 ⁠(在新窗口中打开) 了解更多信息。

这对现有 API 意味着什么

  • Chat Completions API ⁠(在新窗口中打开):Chat Completions 仍然是我们采用最广泛的 API,我们完全致力于用新模型和能力支持它。不需要内置工具的开发人员可以放心地继续使用 Chat Completions。我们将继续向 Chat Completions 发布新模型,只要它们的能力不依赖于内置工具或多个模型调用。然而,Responses API 是 Chat Completions 的 超集 ⁠(在新窗口中打开),具有相同的出色性能,因此对于新集成,我们建议从 Responses API 开始。
  • Assistants API ⁠(在新窗口中打开):根据 Assistants API 测试版的开发人员反馈,我们已将关键改进纳入 Responses API,使其更灵活、更快、更易于使用。我们正在努力实现 Assistants 和 Responses API 之间的完全功能对等,包括对类似 Assistant 和类似 Thread 对象的支持,以及 Code Interpreter 工具。完成后,我们计划正式宣布弃用 Assistants API,目标停用日期为 2026 年中期。弃用时,我们将提供从 Assistants API 到 Responses API 的清晰迁移指南,允许开发人员保留所有数据并迁移其应用程序。在我们正式宣布弃用之前,我们将继续向 Assistants API 交付新模型。Responses API 代表了在 OpenAI 上构建 Agent 的未来方向。

Responses API 中的内置工具简介

网络搜索

开发人员现在可以通过网络获取快速、最新的答案,并带有清晰相关的引用。在 Responses API 中,网络搜索作为工具在使用 gpt-4o 和 gpt-4o-mini 时可用,并且可以与其他工具或函数调用配对使用。

JavaScript

`

1
const response = await openai.responses.create({
2
    model: "gpt-4o",
3
    tools: [ { type: "web_search_preview" } ],
4
    input: "What was a positive news story that happened today?",
5
});
6
  

7
console.log(response.output_text);

` 在早期测试期间,我们看到开发人员使用网络搜索构建了各种用例,包括购物助手、研究 Agent 和旅行预订 Agent——任何需要网络及时信息的应用程序。 例如,Hebbia ⁠(在新窗口中打开) 利用网络搜索工具帮助资产管理公司、私募股权和信贷公司以及法律实践从广泛的公共和私有数据集中快速提取可操作的见解。通过将实时搜索功能集成到他们的研究工作流中,Hebbia 提供了更丰富、更具体的市场情报,并不断提高其分析的精度和相关性,超越了当前基准。 API 中的网络搜索由 ChatGPT 搜索使用的相同模型提供支持。在 SimpleQA(评估 LLM 回答简短事实问题准确性的基准)上,GPT‑4o 搜索预览和 GPT‑4o mini 搜索预览分别得分 90% 和 88%。

SimpleQA 准确率(越高越好) 63%38%47%15%90%88%准确率 使用 API 中的网络搜索生成的响应包括源链接,如新闻文章和博客文章,为用户提供了解更多信息的方式。通过这些清晰的内联引用,用户可以以新的方式与信息互动,同时内容所有者获得了触达更广泛受众的新机会。 任何网站或发布商都可以 选择出现 ⁠(在新窗口中打开) 在 API 的网络搜索中。 网络搜索工具在 Responses API 中以预览形式对所有开发人员可用。我们还通过 gpt-4o-search-previewgpt-4o-mini-search-preview 让开发人员直接访问 Chat Completions API 中的微调搜索模型。定价 ⁠(在新窗口中打开) 分别从每千次查询 30 美元和 25 美元开始,分别适用于 GPT‑4o 搜索和 4o-mini 搜索。在 Playground ⁠(在新窗口中打开) 中查看网络搜索,并在我们的 文档 ⁠(在新窗口中打开) 中了解更多信息。

文件搜索

开发人员现在可以使用改进的文件搜索工具轻松地从大量文档中检索相关信息。通过支持多种文件类型、查询优化、元数据过滤和自定义重新排序,它可以提供快速、准确的搜索结果。此外,通过 Responses API,只需几行代码即可集成。

JavaScript

`

1
const productDocs = await openai.vectorStores.create({
2
    name: "Product Documentation",
3
    file_ids: [file1.id, file2.id, file3.id],
4
});
5
  

6
const response = await openai.responses.create({
7
    model: "gpt-4o-mini",
8
    tools: [{
9
        type: "file_search",
10
        vector_store_ids: [productDocs.id],
11
    }],
12
    input: "What is deep research by OpenAI?",
13
});
14
  

15
console.log(response.output_text);

` 文件搜索工具可用于各种现实用例,包括使客户支持 Agent 能够轻松访问常见问题解答,帮助法律助理为合格专业人员快速参考过去的案例,以及协助编码 Agent 查询技术文档。例如,Navan ⁠(在新窗口中打开) 在其 AI 驱动的旅行 Agent 中使用文件搜索,从知识库文章(如其公司的旅行政策)中快速为用户提供精确答案。通过内置查询优化和重新排序,他们无需额外调整或配置即可建立强大的 RAG(检索增强生成)管道。通过为每个用户组提供专用向量存储,Navan 能够根据个人帐户设置和用户角色定制答案,为客户及其员工节省时间,同时帮助提供准确、个性化的支持。 此工具在 Responses API 中对所有开发人员可用。使用 定价 ⁠(在新窗口中打开) 为每千次查询 2.50 美元,文件存储为每天每 GB 0.10 美元,前 1 GB 免费。该工具在 Assistants API 中继续可用。最后,我们还在 Vector Store API 对象中添加了新的搜索端点,以直接查询您的数据,供其他应用程序和 API 使用。在我们的 文档 ⁠(在新窗口中打开) 中了解更多信息,并在 Playground ⁠(在新窗口中打开) 中开始测试。

计算机使用

为了构建能够在计算机上完成任务的 Agent,开发人员现在可以使用 Responses API 中的计算机使用工具,由启用 Operator 的相同 计算机使用 Agent (CUA) 模型 提供支持。这个研究预览模型创造了新的最新记录,在完整计算机使用任务的 OSWorld ⁠(在新窗口中打开) 上实现 38.1% 的成功率,在 WebArena ⁠(在新窗口中打开) 上实现 58.1%,在基于网络交互的 WebVoyager ⁠(在新窗口中打开) 上实现 87%。 内置计算机使用工具捕获模型生成的鼠标和键盘操作,使开发人员可以通过直接将这些操作转换为其环境中的可执行命令来自动化计算机使用任务。

JavaScript

`

1
const response = await openai.responses.create({
2
    model: "computer-use-preview",
3
    tools: [{
4
        type: "computer_use_preview",
5
        display_width: 1024,
6
        display_height: 768,
7
        environment: "browser",
8
    }],
9
    truncation: "auto",
10
    input: "I'm looking for a new camera. Help me find the best one.",
11
});
12
  

13
console.log(response.output);

` 开发人员可以使用计算机使用工具自动化基于浏览器的工作流,如在 Web 应用程序上执行质量保证或在遗留系统中执行数据输入任务。例如,Unify ⁠(在新窗口中打开) 是一个收入增长行动系统,使用 Agent 识别意图、研究帐户并与买家互动。使用 OpenAI 的计算机使用工具,Unify 的 Agent 可以访问以前通过 API 无法访问的信息——例如,使物业管理公司能够通过在线地图验证企业是否扩大了其房地产足迹。这项研究作为触发个性化外展的自定义信号——使走向市场的团队能够精确和大规模地与买家互动。 作为另一个例子,Luminai ⁠(在新窗口中打开) 集成了计算机使用工具,为缺少 API 可用性和标准化数据的遗留系统的大型企业自动化复杂操作工作流。在最近与一家主要社区服务组织的试点中,Luminai 在短短几天内自动化了申请处理和用户注册流程——这是传统机器人流程自动化 (RPA) 经过数月努力仍难以实现的。 在去年在 Operator 中推出 CUA 之前,我们进行了广泛的安全测试和红队测试,解决了三个关键风险领域:滥用、模型错误和前沿风险。为解决与通过 API 中的 CUA 将 Operator 的能力扩展到本地操作系统相关的风险,我们进行了额外的安全评估和红队测试。我们还为开发人员添加了缓解措施,包括防止提示注入的安全检查、敏感任务的确认提示、帮助开发人员隔离其环境的工具以及增强的潜在策略违规检测。虽然这些缓解措施有助于降低风险,但模型仍容易出现无意错误,特别是在非浏览器环境中。例如,CUA 在 OSWorld(旨在衡量 AI Agent 在现实世界任务上的性能的基准)上的性能目前为 38.1%,这表明该模型在自动化操作系统上的任务方面还不是高度可靠。在这些场景中建议人工监督。有关我们特定于 API 的安全工作的更多详细信息,请参阅我们更新的 系统卡

基准类型基准计算机使用(通用接口)网页浏览 Agent人类
OpenAI CUA先前 SOTA先前 SOTA
计算机使用OSWorld38.1%22.0%-
浏览器使用WebArena58.1%36.2%57.1%
WebVoyager87.0%56.0%87.0%-
评估详情在 此处 描述
从今天开始,计算机使用工具作为研究预览在 Responses API 中提供给 使用层级 3-5 ⁠(在新窗口中打开) 的选定开发人员。使用 定价 ⁠(在新窗口中打开) 为每 1M 输入 token 3 美元和每 1M 输出 token 12 美元。在我们的 文档 ⁠(在新窗口中打开) 中了解更多信息,并查看说明如何使用此工具构建的 示例应用程序 ⁠(在新窗口中打开)

Agents SDK

除了构建 Agent 的核心逻辑并让它们访问工具以使其有用之外,开发人员还需要编排 Agentic 工作流。我们新的开源 Agents SDK 简化了多 Agent 工作流的编排,并提供了相对于 Swarm ⁠(在新窗口中打开) 的重大改进,Swarm 是我们去年发布的实验性 SDK,被开发人员社区广泛采用并由多个客户成功部署。 改进包括:

  • Agent:易于配置的 LLM,具有清晰的指令和内置工具。
  • 交接:智能地在 Agent 之间转移控制权。
  • 防护措施:用于输入和输出验证的可配置安全检查。
  • 追踪和可观测性:可视化 Agent 执行追踪以调试和优化性能。

Python

`

1
from agents import Agent, Runner, WebSearchTool, function_tool, guardrail
2
  

3
@function_tool
4
def submit_refund_request(item_id: str, reason: str):
5
    # Your refund logic goes here
6
    return "success"
7
  

8
support_agent = Agent(
9
    name="Support & Returns",
10

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.