
如何使用可观测性调试和评估 AI 智能体——LangChain 指南
你无法在不了解智能体如何推理的情况下构建可靠的智能体,你也无法在没有系统评估的情况下验证改进。本文解释了智能体可观测性的原语,如何在不同粒度上评估智能体,以及生产追踪如何成为持续改进的基础。
共 15 篇文章

你无法在不了解智能体如何推理的情况下构建可靠的智能体,你也无法在没有系统评估的情况下验证改进。本文解释了智能体可观测性的原语,如何在不同粒度上评估智能体,以及生产追踪如何成为持续改进的基础。

💡 摘要:最好的智能体评估直接衡量我们关心的智能体行为。以下是我们如何采购数据、创建指标,以及随着时间的推移运行范围明确、有针对性的实验,以使智能体更准确和可靠。


AI 智能体已经到来,并且已经部署在后果差异很大的各种场景中,从电子邮件分类到网络间谍活动。理解这个范围对于安全部署 AI 至关重要,但我们对人们在现实世界中实际如何使用智能体知之甚少。

本笔记本使用 OpenAI Evals 框架和自定义内存数据集,评估模型回答关于 tiktoken GitHub 仓库的问题的能力。

十二个月前,我们会断然拒绝授予 Claude 足以关闭 Anthropic 内部服务的访问权限的想法。今天,这种级别的访问已经成为常规,Anthropic 开发者因此而更高效。这些部署的风险由两部分组成:故障发生的可能性,以及故障可能造成的

_共同作者:Sally-Ann DeLucia,产品总监;Chris Cooning,产品营销负责人;Priyan Jindal,AI 工程师;Jack Zhou,资深软件工程师。_

游润洋\共同1 蔡宏儒\共同1 张彩琪2 徐乾城1 刘猛3 余铁铮4 李永琪\通讯作者1 李文杰1



当一个Agent系统出现故障时,问题往往比单次错误响应更严重。交接可能发生得太晚,专家Agent可能在多次运行中遗漏相同的信号,或者审查流程可能针对错误的案例类型触发。为了改进系统,团队需要看到整个追踪群体中的重复行为。

当您为像 Codex 这样的智能体迭代技能时,很难判断您是真的在改进它,还是只是在改变它的行为。一个版本感觉更快,另一个似乎更可靠,然后一个回归悄悄出现:技能没有触发,它跳过了一个必要的步骤,或者留下了额外的文件。

本笔记本为智能体构建一个改进飞轮。我们从真实追踪开始,添加人工和模型反馈,将该反馈转化为评测,然后使用结果证据提出下一个框架变更,供Codex实施。

良好的评估帮助团队更自信地发布 AI 智能体。没有它们,很容易陷入被动循环——只在生产中发现问题,而修复一个故障又会制造其他问题。评估在问题影响用户之前使问题和行为变化变得可见,它们的价值在智能体的整个生命周期中不断累积。

2026 年 5 月 21 日 Ameya Bhatawdekar 和 Tony Xu 33 分钟