
共 20 篇文章


在我们编写任何代码之前,有一点需要明确。
![[2604.14228] 深入探讨 Claude Code:当今和未来 AI 智能体系统的设计空间](/images/cover-default.jpg)

AI 智能体的未来是模型可以无缝地跨数百或数千个工具工作。一个集成 Git 操作、文件操作、包管理器、测试框架和部署管道的 IDE 助手。一个可以同时连接 Slack、GitHub、Google Drive、Jira、公司数据库和数十个 M



你无法在不了解智能体如何推理的情况下构建可靠的智能体,你也无法在没有系统评估的情况下验证改进。本文解释了智能体可观测性的原语,如何在不同粒度上评估智能体,以及生产追踪如何成为持续改进的基础。


2025 年不是关于单一模型发布——这一年 AI 在生产环境中运行变得更加容易。随着模型在规划、工具使用和长期任务方面的改进,越来越多的团队从"逐步提示"转向将工作委派给智能体。

AI 智能体已经到来,并且已经部署在后果差异很大的各种场景中,从电子邮件分类到网络间谍活动。理解这个范围对于安全部署 AI 至关重要,但我们对人们在现实世界中实际如何使用智能体知之甚少。

本笔记本使用 OpenAI Evals 框架和自定义内存数据集,评估模型回答关于 tiktoken GitHub 仓库的问题的能力。

十二个月前,我们会断然拒绝授予 Claude 足以关闭 Anthropic 内部服务的访问权限的想法。今天,这种级别的访问已经成为常规,Anthropic 开发者因此而更高效。这些部署的风险由两部分组成:故障发生的可能性,以及故障可能造成的

当一个Agent系统出现故障时,问题往往比单次错误响应更严重。交接可能发生得太晚,专家Agent可能在多次运行中遗漏相同的信号,或者审查流程可能针对错误的案例类型触发。为了改进系统,团队需要看到整个追踪群体中的重复行为。

当您为像 Codex 这样的智能体迭代技能时,很难判断您是真的在改进它,还是只是在改变它的行为。一个版本感觉更快,另一个似乎更可靠,然后一个回归悄悄出现:技能没有触发,它跳过了一个必要的步骤,或者留下了额外的文件。

本笔记本为智能体构建一个改进飞轮。我们从真实追踪开始,添加人工和模型反馈,将该反馈转化为评测,然后使用结果证据提出下一个框架变更,供Codex实施。

良好的评估帮助团队更自信地发布 AI 智能体。没有它们,很容易陷入被动循环——只在生产中发现问题,而修复一个故障又会制造其他问题。评估在问题影响用户之前使问题和行为变化变得可见,它们的价值在智能体的整个生命周期中不断累积。

2026 年 5 月 21 日 Ameya Bhatawdekar 和 Tony Xu 33 分钟

开发者在他们所做的一切中都追求一致性。借助 Codex CLI 和 Agents SDK,这种一致性现在可以以前所未有的方式扩展。无论您是在重构大型代码库、推出新功能还是引入新的测试框架,Codex 都能无缝集成到 CLI、IDE 和云工作

从配置环境到跨并行会话扩展,充分利用 Claude Code 的技巧和模式。
