分类

Phase 6 · 评测安全与生产

15 篇文章

实践中衡量 AI 智能体自主性

实践中衡量 AI 智能体自主性

AI 智能体已经到来,并且已经部署在后果差异很大的各种场景中,从电子邮件分类到网络间谍活动。理解这个范围对于安全部署 AI 至关重要,但我们对人们在现实世界中实际如何使用智能体知之甚少。

Anthropic·9 阅读
Agent系统的宏观评估

Agent系统的宏观评估

当一个Agent系统出现故障时,问题往往比单次错误响应更严重。交接可能发生得太晚,专家Agent可能在多次运行中遗漏相同的信号,或者审查流程可能针对错误的案例类型触发。为了改进系统,团队需要看到整个追踪群体中的重复行为。

OpenAI·8 阅读
解读 AI 智能体评估

解读 AI 智能体评估

良好的评估帮助团队更自信地发布 AI 智能体。没有它们,很容易陷入被动循环——只在生产中发现问题,而修复一个故障又会制造其他问题。评估在问题影响用户之前使问题和行为变化变得可见,它们的价值在智能体的整个生命周期中不断累积。

Anthropic·8 阅读
91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.