
使用 Claude Code 和 OpenAI Codex 发现现代 Web 应用中的漏洞 | Semgrep
内容摘要: 我们评估了 AI 编程智能体在真实代码中发现漏洞的有效性。
共 20 篇文章

内容摘要: 我们评估了 AI 编程智能体在真实代码中发现漏洞的有效性。

生成式 AI 如此彻底地改变了软件开发,以至于你可以在几小时内构建完整的服务,但理解这些服务出了什么问题仍然需要在碎片化的工具中进行艰苦的工作。从代码生成到代码审查,编码智能体处理构建方面。但生产调试?那仍然是手动的。看以下示例:

技术团队成员:Aravind Srinivasan & Samay Shamdasani(Thrive Holdings),Arthur Fernandes Araujo & John de Wasseige(OpenAI)


在工作流结构清晰后,接下来的问题是哪些外部接口应该存在于 Agent 循环中,以及您将如何检查运行时实际发生的情况。

Secure MCP Tunnel(安全 MCP 隧道)允许您将私有 MCP 服务器连接到支持的 OpenAI 产品,无需开放入站防火墙端口或将这些服务器暴露到公共互联网。在能够访问您的 MCP 服务器的网络内运行 tunnel-clien


您可以将 Codex 作为 MCP 服务器运行,并从其他 MCP 客户端连接它(例如,使用 OpenAI Agents SDK MCP 集成构建的智能体)。

默认情况下,Claude Code 在运行命令或修改文件之前会要求用户批准。这可以保护用户安全,但也意味着要频繁点击"批准"。随着时间的推移,这会导致批准疲劳,人们不再密切关注他们正在批准的内容。

ChatGPT 支持用于嵌入式应用 UI 的 MCP Apps 开放标准。


更新后的 OpenAI Agents SDK 为团队提供了模型原生的框架,用于构建可以在工具、文件、内存、审批和沙箱计算之间协调的智能体。它是开源的,因此团队可以检查和自定义运行时行为。您不必为每个模型集成重新构建这些组件,而是可以使用一个

Claude Sonnet 4.5 是世界上最好的编码模型。它是构建复杂智能体的最强模型。它是使用计算机最好的模型。它在推理和数学方面也显示出实质性的进步。


智能体编码基准测试(如 SWE-bench 和 Terminal-Bench)通常用于比较前沿模型的软件工程能力——排行榜上的前几名往往仅相差几个百分点。这些分数经常被视为相对模型能力的精确衡量标准,并越来越多地影响关于部署哪些模型的决策。

今天,我们正在将 模型上下文协议(MCP)捐赠给 Agentic AI 基金会(AAIF)——这是 Linux 基金会 旗下的一个定向基金,由 Anthropic、Block 和 OpenAI 共同创立,并得到 Google、Microso

_作者:Tristan Hume,Anthropic 性能优化团队负责人。Tristan 设计(并重新设计)了帮助 Anthropic 聘用数十名性能工程师的带回家测试。_


_了解 Skyscanner 如何通过将 OpenAI 的 Codex CLI 与 JetBrains IDE 集成,为他们的 AI 助手提供与人类开发者相同的调试和测试工具。_

首次发布:2023 年 6 月 14 日。最后更新:2025 年 12 月 22 日