Phase 6 · 评测安全与生产

智能体即裁判(Agent-as-a-Judge)综述

学术·2026/7/21·10 阅读

智能体即裁判(Agent-as-a-Judge)综述

来源: https://arxiv.org/html/2601.05111v1 抓取时间: 2026-07-21 16:22:58


\公开日期 2026-1-8

智能体即裁判(Agent-as-a-Judge)综述

游润洋\共同1 蔡宏儒\共同1 张彩琪2 徐乾城1 刘猛3 余铁铮4 李永琪\通讯作者1 李文杰1 1 香港理工大学 2 剑桥大学 3 山东建筑大学 4 华为技术有限公司 \共同 共同第一作者 \通讯 通讯作者 runyang.y@outlook.com, {henry.hongrucai, liyongqi0}@gmail.com, cswjli@comp.polyu.edu.hk

摘要

LLM 即裁判(LLM-as-a-Judge)通过利用大型语言模型进行可扩展评估,彻底改变了 AI 评估领域。然而,随着评估对象变得越来越复杂、专业化和多步骤,LLM 即裁判的可靠性受到固有偏见、浅层单次推理以及无法根据现实世界观察验证评估的限制。这推动了向智能体即裁判(Agent-as-a-Judge)的转变,其中智能体裁判利用规划、工具增强验证、多智能体协作和持久记忆,以实现更稳健、可验证和细致的评估。尽管智能体评估系统迅速普及,但该领域缺乏一个统一的框架来导航这一不断变化的格局。为了填补这一空白,我们提出了第一个全面的综述,追溯这一演变。具体而言,我们确定了表征这一范式转变的关键维度,并建立了发展分类法。我们组织了通用和专业领域的核心方法和综述应用。此外,我们分析了前沿挑战并确定了有前景的研究方向,最终为下一代智能体评估提供了清晰的路线图。

1 引言

参见标题 (a) LLM 即裁判 参见标题 (b) 智能体即裁判 图 1:LLM 即裁判(1(a))和智能体即裁判(1(b))的比较。前者执行直接的单次评估,而后者利用规划、记忆和工具增强能力来增强评估。 大型语言模型(LLM)的快速发展彻底改变了 AI 评估领域,催生了 LLM 即裁判范式 [Zheng2023Judging]。虽然传统指标无法捕捉语义细微差别,且人类评估无法扩展,但这种新方法利用 LLM 的高级理解和决策能力,在各个领域提供接近人类质量的评估 [li2025LLM-as-a-Judge-Survey]。此外,作为人类偏好的可扩展代理,LLM 裁判可以为强化学习提供奖励信号 [lee2024RLAIF-vs-RLHF],并实现大规模合成数据集的自动策划 [long2024llmsdatageneration]。因此,LLM 判断已成为 AI 评估和优化管道的基石,其中裁判的精度至关重要地决定了下游应用的成功 [lai2025post-training-scaling]。 然而,随着生成式 AI 应用从简单的文本响应演变为跨专业领域的复杂多步骤任务,LLM 即裁判的可靠性不可避免地受到限制 [li2025LLM-as-a-Judge-Survey, xi2025LLM-agent-survey]。首先,单次评估器容易受到固有参数偏见的影响——例如偏好冗长或自己的输出模式——这在评估偏离其训练分布的高复杂度响应时会损害其中立性 [wang2024-LLMs-are-not-fair]。其次,朴素的 LLM 裁判是被动观察者,无法对现实世界的观察做出反应;它们根据语言模式评估答案而不进行验证,导致在专业领域产生幻觉评估 [peng2025AgenticRM]。此外,在需要多方面评估规则的评估任务中,传统 LLM 裁判在尝试在单个推理步骤中全面评估所有维度时会遇到认知过载,导致粗粒度分数无法反映特定细微差别 [zhang2025HiMATE]。 这些局限性推动了从 LLM 即裁判向智能体即裁判的转变。如图 1 所示,智能体裁判通过多种能力主动参与评估:它们将复杂目标分解为子任务,通过多智能体协作减轻偏见 [chan2024ChatEval],通过工具增强的证据收集和正确性验证来锚定评估 [peng2025AgenticRM],并通过持久化中间状态实现细粒度评估,自主规划跨推理步骤的评估 [zhao2025RLPA, ding2025ARMThinker]。这种范式转变使得更稳健、可验证和细致的评估成为可能,从而有效解决复杂 AI 生成评估对象的多方面性质。 尽管智能体评估系统具有上述潜力并迅速普及,但该领域缺乏一篇综述来总结和导航这一不断变化的格局。为了填补这一空白,我们通过以下贡献提出了第一个关于智能体即裁判的全面综述:

  • • 我们识别并表征了从 LLM 即裁判到智能体即裁判的转变,并将智能体裁判的发展趋势总结为三个渐进阶段(第 2 节)。
  • • 我们根据智能体的能力将核心方法组织为五个关键部分(第 3 节),并综述了它们在通用和专业领域的应用(第 4 节)。
  • • 我们分析了前沿挑战并确定了有前景的研究方向,为下一代稳健且可验证的 AI 判断提供了战略路线图。

2 演变:从 LLM 即裁判到智能体即裁判

智能体即裁判应用(第 4 节)专业领域(第 4.2 节)教育 例如,MAJ-Eval [chen2025MultiAgentasJudge]、AutoSCORE [wang2025autoscore]、GradeOpt [chu2024llm]、Grade-Like-a-Human [xie2024grade] 金融 例如,FinResearchBench [sun2025finresearchbench]、FinDeepResearch [zhu2025findeepresearch]、SAEA [chen2025standardbenchmarksfail]、M-SAEA [chen2025tasks] 法律 例如,AgentsCourt [he2024agentscourt]、SAMVAD [devadiga2025samvad]、AgentsBench [jiang2025agentsbench] 医学 例如,MAJ-Eval [chen2025MultiAgentasJudge]、GEMA-Score [zhenxuan2025GEMA-Score]、ChatCoach [huang2024benchmarking]、AI Hospital [fan2025ai] 通用领域(第 4.1 节)多模态和视觉 例如,CIGEval [wang-etal-2025-unified]、Evaluation Agent [zhang2025EvaluationAgent]、LRQ-Fact [beigi2024lrqfact]、ARM-Thinker [ding2025ARMThinker] 对话和交互 例如,IntellAgent [levi2025intellagent]、ESC-Judge [madani-srihari-2025-esc]、Sentient Agent [zhang2025sentient]、PSYCHE [lee2025psyche] 事实核查 例如,FACT-AUDIT [lin-etal-2025-fact]、UrduFactCheck [ahmad-etal-2025-urdufactcheck]、NarrativeFactScore [jeong-etal-2025-agent] 数学和代码 例如,HERMES [ospanov2025HERMES]、VerifiAgent [han2025VerifiAgent]、CompassVerifier [liu-etal-2025-compassverifier]、xVerify [chen2025xverify]、Agentic Reward Modeling [peng2025AgenticRM]、Multi-Agent Verification [lifshitz2025multi]、Popper [huang2025popper] 方法(第 3 节)优化范式(第 3.5 节)例如,Promptin... [已截断] 图 2:智能体即裁判的分类法,组织了方法(第 3 节)和应用(第 4 节)。背景渐变说明了发展阶段的覆盖范围,从程序化到反应式,再到自我进化。 本节追溯了自动化评估从 LLM 即裁判到智能体即裁判范式的演变。我们首先回顾了基础的 LLM 即裁判及其局限性。然后,我们研究了向智能体即裁判的转变,分析了表征智能体方法的关键维度。最后,我们将智能体即裁判的发展趋势总结为三个渐进阶段,具有不同程度的自主性和适应性。

2.1 LLM 即裁判

LLM 即裁判范式的出现是为了克服人类评估的可扩展性限制和传统指标的语义不敏感性。Zheng 等人 [Zheng2023Judging] 通过引入像 MT-Bench 这样的基准来评估模型对齐,正式确立了这种方法。在此基础上,G-Eval [liu2023G-Eval] 利用思维链提示,在自然语言生成(NLG)中实现更好的对齐,而 Prometheus [kim2023Prometheus] 通过专门的调优在开源模型中诱导细粒度评估。为了减轻系统性问题,如位置和冗长偏见 [wang2024-LLMs-are-not-fair],JudgeLM [zhu2025judgelm] 利用微调开发了更稳健的评估器。

2.2 从 LLM 即裁判到智能体即裁判

随着评估对象从简单的文本响应演变为跨专业领域的复杂多步骤任务,传统的 LLM 即裁判变得越来越不足,它专注于最终输出,而无法验证中间动作或满足专业领域的严格标准 [li2025LLM-as-a-Judge-Survey, xi2025LLM-agent-survey]。为了填补这一空白,范式正在转向智能体即裁判,它采用去中心化审议、可执行验证和细粒度评估来减轻这些局限性。

演变的稳健性:从单片到去中心化。

为了减轻单片 LLM 裁判的固有参数偏见——例如偏好冗长或自己的输出模式的倾向——智能体即裁判范式采用专门的去中心化智能体,通过自主决策进行协作 [chan2024ChatEval, chen2025MultiAgentasJudge]。至关重要的是,这种去中心化架构促进了专家先验知识的注入:通过将复杂的评估目标分解为子任务或构建特定的交互工作流,我们可以强制执行通才模型通常会忽略的领域特定约束 [xie2024grade, zhenxuan2025GEMA-Score]。此外,多智能体审议确保了集体稳健性;不同的角色可以隔离特定的信息点以中和偏见,而辩论和自我反思允许智能体审计自己的认知捷径,确保最终判断超越任何单个模型的启发式方法 [lyu2025debiasingLLM, wang2024-LLMs-are-not-fair]。

演变的验证:从直觉到执行。

静态 LLM 裁判本质上是被动观察者,无法对现实世界的反馈做出反应。它们根据语言合理性评估答案——响应看起来有多正确——而不进行验证或证据收集,导致复杂任务中的「正确性幻觉」 [peng2025AgenticRM]。智能体即裁判通过用执行取代直觉来弥合这一现实差距。通过与外部环境交互,智能体裁判可以查询系统状态以验证副作用(例如,文件操作) [zhuge2025AgentasaJudge, wang2025CodeVisionary],使用代码解释器或定理证明器来验证逻辑一致性 [ospanov2025HERMES],并使用搜索工具将事实主张锚定在实时文档中 [han2025VerifiAgent, peng2025AgenticRM]。这将评估锚点从内部模型知识转移到客观验证。

演变的粒度:从全局到细粒度。

许多评估任务本质上需要多方面的评估规则,但传统 LLM 裁判在单个推理步骤中全面评估这些维度时会面临认知过载,导致粗粒度分数无法反映特定细微差别 [zhang2025HiMATE]。智能体即裁判通过将评估从单次推理转变为自主的分层推理来解决这一问题 [zhang2025HiMATE]。智能体裁判不是进行单片评估,而是可以动态选择或创建特定于任务的规则,自主规划评估以独立检查评估对象的每个组件 [ghosh2024SAGEval],利用内存跟踪历史推理状态并将零散的证据合成为连贯的结论。因此,这些智能体可以精确定位否则会在全局分数中被掩盖的特定缺陷,提供关于每个方面的细粒度反馈 [li2025AGENT-X]。

2.3 智能体即裁判

智能体即裁判代表了一个快速扩展的领域,其中「智能体」一词经常被松散地应用,涵盖了从程序化智能体工作流到自主自我进化者的异质范围 [chan2024ChatEval, li2025AGENT-X, ding2025ARMThinker]。为了提供清晰的路线图来应对这种复杂性,我们将智能体的持续发展总结如下。

程序化智能体即裁判

将单片推理解耦为智能体预定义的工作流 [su2025CAFES, zhenxuan2025GEMA-Score] 或参与固定子智能体之间的结构化讨论 [chan2024ChatEval, feng2025MMAD]。这些系统通过协调的多智能体交互实现复杂判断,但仍然受到预定决策规则的限制,无法适应新的评估场景。

反应式智能体即裁判

通过路由执行路径 [zhang2025EvaluationAgent, li2025AGENT-X] 并基于中间反馈调用外部工具 [peng2025AgenticRM] 或子智能体 [chen2025MultiAgentasJudge] 来实现自适应决策。然而,这种反应性仍然局限于固定决策空间内的条件路由,缺乏优化底层规则的自主性。

自我进化智能体即裁判

代表了该领域的前沿,其特点是高度自主,能够在运行期间优化内部组件——动态合成评估规则 [wadhwa2025EvalAgents] 并更新记忆中的经验教训。这种范式为自适应评估系统开辟了新的前沿,尽管在确保自我修改期间的稳定性方面仍存在挑战 [gao2025self-evolving-agent-survey]。

3 方法

本节将智能体即裁判方法分类为五个维度:多智能体协作、规划、工具集成、记忆和个性化以及优化范式。如图 2 所示,实现的复杂性揭示了进化阶段:基础方法(协作、工具集成、优化)在所有阶段都在演变,而其他方法(规划、记忆)在高级范式中更突出。以下小节检查每个方法如何在这些阶段中体现。

3.1 多智能体协作

参见标题 (a) 集体共识 参见标题 (b) 任务分解 图 3:多智能体协作范式。 多智能体协作利用集体推理来减轻智能体即裁判系统中的单 LLM 偏见。早期系统遵循具有固定协议的程序化范式,而最近的工作正在向基于反馈自适应选择智能体的反应式方法发展。我们将这些分类为两种拓扑:

集体共识。

横向辩论机制利用代表不同视角的智能体来抵消单 LLM 评估器的固有偏见,如图 3 所示。早期方法体现了程序化阶段:ChatEval [chan2024ChatEval] 开创了这一点,采用法庭式讨论机制,其中智能体作为平等角色遵循预定义协议进行辩论。这种范式后来在 M-MAD [feng2025MMAD] 中扩展到机器翻译,而后续研究 [koupaee2025Faithful] 引入了明确的立场和「裁判」角色,以防止智能体盲目服从多数。最近的方法变得更加自我进化:像多智能体即裁判 [chen2025MultiAgentasJudge] 这样的方法已经超越了静态集成,通过基于中间反馈创建特定领域的专家。

任务分解。

任务分解采用「分而治之」策略,将不同的子任务委托给专门的智能体进行系统评估,如图 3 所示。早期框架遵循程序化设计:像 CAFES [su2025CAFES] 和 GEMA-Score [zhenxuan2025GEMA-Score, kumar2025courteval] 这样的顺序方法将评估结构化为预定义阶段(例如,证据收集、推理、评分),而 SAGEval [ghosh2024SAGEval] 通过「裁判之裁判」元评估器引入监督,该元评估器审查先前智能体的决策,像 HiMATE [zhang2025HiMATE] 这样的分层方法将智能体组织成树结构,以适应不同的错误粒度。最近的工作已经转向反应式范式:AGENT-X [li2025AGENT-X] 采用自适应路由智能体,根据中间分析结果动态选择最相关的基础智能体。 要点 多智能体评估框架采用两种主要拓扑:集体共识和任务分解。最近的进展已经朝着更自主的系统发展,可以选择或生成子智能体。

3.2 规划

规划是智能体即裁判范式中的核心能力,能够将高级评估目标分解为可执行的子任务,并基于中间分析动态调整评估轨迹。本节从两个角度检查规划能力:

工作流编排。

智能体即裁判系统中的工作流编排从静态框架到动态智能体不等,主要表征智能体评估的程序化和反应式阶段。像 MATEval [Li2024MATEval] 这样的方法依赖于静态分解,将任务分解为固定的子维度序列。虽然这通过预定义的控制流确保了系统评估,但它限制了复杂场景中的适应性。相反,Evaluation Agent [zhang2025EvaluationAgent] 引入了动态多轮规划,其中智能体基于中间反馈调整策略。该系统通过自主终止进一步优化效率,允许智能体自我监控信息增益,并在收集到足够证据后主动停止执行。

规则发现。

与专注于任务完成的通用智能体不同,裁判智能体具有自主制定和优化规则的独特能力,这代表了自我进化阶段的标志,其中智能体可以优化其内部评估组件。EvalAgents [wadhwa2025EvalAgents] 例证了这一点,它使用查询生成器来规划网络搜索以发现隐式规则,而 AGENT-X [li2025AGENT-X] 使用自适应路由器来推断领域上下文并规划定制的检测指南。ARJudge [xu2025ARJudge] 通过迭代生成上下文敏感的问题来自适应制定规则,而 OnlineRubrics [rezaei2025OnlineRubrics] 将规划集成到强化学习中,在策略优化过程中演变规则以检测奖励黑客。 要点 规划作为战略引擎,将评估从刚性流转变为自适应探索,使智能体能够优化如何评估(工作流编排)和评估什么(规则发现)。

3.3 工具集成

工具用途方法评估任务工具类型
证据收集智能体即裁判 [zhuge2025AgentasaJudge]代码生成图、定位、读取、搜索、检索
CodeVisionary [wang2025CodeVisionary]代码生成代码执行、静态 linter、单元测试、屏幕截图、网络浏览
Evaluation Agent [zhang2025EvaluationAgent]视觉生成视觉生成模型
ARM-Thinker [ding2025ARMThinker]多模态生成指令遵循检查、裁剪/缩放工具、文档检索工具
正确性验证HERMES [ospanov2025HERMES]数学推理翻译器、定理证明器
VerifiAgent [han2025VerifiAgent]事实与数学推理搜索引擎、Python 解释器、定理证明器
Agentic RM [peng2025AgenticRM]事实与数学推理搜索引擎、Python 解释器
表 1:代表性智能体即裁判方法中的工具集成,按主要工具使用目的分组。
工具集成是智能体即裁判框架的核心能力,使裁判能够将评估锚定在外部证据和显式检查上。如表 1 所示,根据工具使用的目的,现有方法可以分为证据收集和正确性验证。

证据收集。

智能体即裁判框架中工具的常见用途是收集支持评估的额外证据。此类证据包括无法通过基于文本的推理可靠获得的中间工件、执行结果和感知信号。在代码相关任务中,智能体即裁判 [zhuge2025AgentasaJudge] 和 CodeVisionary [wang2025CodeVisionary] 允许裁判检查执行工件或运行自动化检查,以暴露评估的执行反馈。类似的方法在多模态设置中被采用。Evaluation Agent [zhang2025EvaluationAgent] 使裁判能够调用外部视觉模型以获得视觉质量或对齐信号,而 ARM-Thinker [ding2025ARMThinker] 通过文档访问和局部视觉操作收集细粒度的视觉和上下文证据。总体而言,这些工作集成工具以揭示可观察的、与任务相关的证据,扩大裁判对执行层、感知和上下文信息的访问,并支持更可靠的评估。

正确性验证。

另一类工作使用工具来验证评估对象的输出或中间推理步骤是否满足显式正确性约束,例如逻辑有效性、数学合理性或事实一致性。在这些框架中,裁判智能体识别哪些主张或步骤需要验证,并调用适当的工具来检查它们。然后,裁判智能体在上下文中解释生成的验证信号,以提供最终评估信息。HERMES [ospanov2025HERMES] 通过形式定理证明验证数学推理,而 VerifiAgent [han2025VerifiAgent] 调用程序化和符号检查器来验证事实和计算主张。Agentic Reward Modeling [peng2025AgenticRM] 进一步集成了正确性验证,它结合了事实检查工具和程序化验证器,以产生结构化的正确性信号,为最终评估提供信息。 要点 智能体即裁判中的工具集成通过允许裁判通过外部工具主动收集证据并检查正确性,将评估锚定在可观察和可验证的信号上。

3.4 记忆和个性化

记忆使智能体即裁判框架能够跨评估步骤保留信息,支持多步推理、一致判断和先前结果的重用。我们根据记忆的角色对现有工作进行分类,包括中间状态跟踪和个性化上下文保留。

中间状态。

在多步骤评估设置中,智能体即裁判框架使用记忆来保留评估期间生成的中间评估状态,为基于中间反馈的条件路由和自适应决策提供必要的上下文——这是反应式智能体即裁判的基本机制。HERMES [ospanov2025HERMES] 在结合推理与形式定理证明时保留中间证明状态,从而在长推理链中实现一致的验证。ARM-Thinker [ding2025ARMThinker] 保留中间证据,例如视觉推理输出和工具交互结果,这些证据稍后被重用以锚定评估。智能体即裁判 [zhuge2025AgentasaJudge] 记录执行跟踪和步骤级反馈,使得评估能够超越最终输出,以考虑中间行为。总的来说,这些方法使用记忆来保留中间状态,支持累积的、步骤感知的评估。

个性化上下文。

智能体即裁判框架通常结合记忆来保留与用户相关的信息,这些信息会在交互过程中影响评估。这种记忆捕获用户偏好、评估标准或先前的反馈,使判断随时间保持一致。PersRM-R1 [li2025PersRMR1] 和 FSPO [singh2025FSPO] 存储从历史交互中派生的偏好数据,包括偏好标签或少样本示例,这些数据被重用以影响同一用户的后续评估。更先进的方法将历史偏好信号抽象为持久的用户角色或长期档案。RLPA [zhao2025RLPA] 和 SynthesizeMe [ryan2025SynthesizeMe] 通过构建和维护用户档案来例证这一点,这些档案被存储并重用以指导评估。这种长期用户画像通常用于支持自我进化的智能体即裁判,使得能够基于不断演变的偏好进行持续优化。总之,这些方法使用记忆来保留个性化上下文,塑造评估行为并确保跨交互的一致性。 要点 记忆使智能体即裁判能够保留中间状态和个性化上下文,支持多步骤评估、一致判断和先前信息的有效重用。

3.5 优化范式

优化范式定义了智能体即裁判如何通过更新模型参数或调整评估行为来提高评估质量。我们将现有工作组织为两类:训练时优化和推理时优化。

训练时优化。

训练时优化通过更新模型参数以使判断行为与评估目标保持一致来改进智能体即裁判。监督微调通常用于标准化裁判行为,训练模型遵循显式标准,并在任务中产生结构化判断。例如,SynthesizeMe [ryan2025SynthesizeMe] 使用从历史数据派生的角色引导监督来塑造评估行为。强化学习优化裁判,使其更有效地执行评估操作,尤其是在需要工具使用和多步骤验证的设置中。TIR-Judge [xu2025TIRJudge] 和 ARM-Thinker [ding2025ARMThinker] 训练裁判,以决定何时以及如何调用工具、集成外部信号和验证中间结果。总之,训练时优化塑造了内部决策过程,实现了更可靠、结构化的评估。

推理时优化。

推理时优化通过控制如何通过提示、工作流或智能体交互生成判断来调整评估行为,而无需更新模型参数。现有方法可以大致分为两类。1) 第一类遵循预定义的评估程序,其中推理步骤、验证例程或提示预先固定,以确保一致性和效率。Evaluation Agent [zhang2025EvaluationAgent] 和 HERMES [ospanov2025HERMES] 通过采用结构化的逐步评估管道来例证这一设置。2) 第二类允许评估行为在推理过程中自适应,其中评估过程、参与的智能体或应用的标准基于中间结果而变化。Multi-Agent LLM Judge [cao2025MultiAgentLLMJudge] 通过多裁判协调迭代优化提示和上下文,而 SAGEval [ghosh2024SAGEval] 引入元裁判来监控和修改裁判行为。ChatEval [chan2024ChatEval] 和 AGENT-X [li2025AGENT-X] 通过智能体交互和动态指南选择进一步支持自适应评估。总体而言,推理时优化实现了对评估行为的灵活控制,范围从固定程序到自适应的、交互驱动的判断。 要点 优化通过在训练时通过参数更新学习评估行为或在推理时调整评估策略来改进智能体即裁判。

4 应用

参见标题 图 4:智能体即裁判应用领域及其细粒度任务类别的概述。 基于上述方法,本节描述了智能体即裁判方法如何在不同的评估任务中应用。如图 4 所示,我们将代表性应用组织为两类:通用领域和专业领域。

4.1 通用领域

数学和代码。

在数学和代码评估中,智能体即裁判系统通过将判断锚定在可验证的推理信号上,超越了单次评分。一类工作通过显式正确性检查增强了自由形式推理。HERMES [ospanov2025HERMES] 将 LLM 推理锚定在中间形式证明步骤上,减少了长推导中的漂移。VerifiAgent [han2025VerifiAgent] 将高级推理评估与基于工具的正确性验证解耦,实现跨推理类型的自适应检查。CompassVerifier [liu-etal-2025-compassverifier] 和 xVerify [chen2025xverify] 专注于数学和逻辑输出,解决了不同表面形式下的等价检查问题。其他方法通过聚合多个评估信号来加强判断。Multi-Agent Verification [lifshitz2025multi] 将评估分配给特定方面的裁判。Agentic Reward Modeling [peng2025AgenticRM] 将基于偏好的监督与可验证的正确性信号相结合,以提高奖励可靠性。Popper [huang2025popper] 将判断表述为受控证伪,使用统计测试来验证自由形式主张。

事实核查。

在事实核查中,智能体即裁判将评估从静态标签预测重新定义为交互式验证,包括证据收集和证明。FACT-AUDIT [lin-etal-2025-fact] 将事实核查建模为具有多智能体协作的智能体循环,联合评估裁决准确性和证明质量。当证据稀缺或不一致性微妙时,这种范式特别有效。UrduFactCheck [ahmad-etal-2025-urdufactcheck] 通过多语言检索和证据增强提高了低资源设置中的鲁棒性。NarrativeFastScore [jeong-etal-2025-agent] 通过构建字符级知识表示来解决长上下文事实一致性问题,从而能够检测状态和关系错误并提供可操作的反馈。

对话和交互。

在对话和交互中,智能体即裁判从对孤立回复的评分转变为构建多轮交流,从而能够在不断演变的目标、约束和用户反应下进行评估。对于任务导向型对话,IntellAgent [levi2025intellagent] 使用交互式用户模拟来合成对话基准,而 kazi2024large 引入了可控用户目标和自动测量的框架。对于情感和社交互动,ESC-Judge [madani-srihari-2025-esc] 通过标准化的咨询技能构建情感支持智能体,Sentient Agent [zhang2025sentient] 跟踪随时间推移的情感轨迹以反映高阶社会认知,而 PSYCHE [lee2025psyche] 构建精神病患者档案用于伦理评估验证。wu2023large 将评估框定为多视角角色扮演,使用不同的评论者角色来覆盖客观和主观维度。

多模态和视觉。

在多模态和视觉领域,智能体即裁判从静态评分转变为交互式检查。对于视觉生成,CIGEval [wang-etal-2025-unified] 编排专门的工具来探测控制粘附和主题一致性,而 Evaluation Agent [zhang2025EvaluationAgent] 运行多轮检查以提供用户定制的、可解释的分析。对于真实性评估,LRQ-Fact [beigi2024lrqfact] 跨图像和文本生成有针对性的事实核查问题,以指导证据检索,而 ARM-Thinker [ding2025ARMThinker] 选择性地调用如图像检查等工具来最终确定判断。

4.2 专业领域

医学。

在高风险的临床 NLP 中,智能体即裁判以两种形式出现:1) 将临床质量分解为专门角色的多智能体评估器,以及 2) 交互式引出临床行为的智能体模拟器。对于 1),MAJ-Eval [chen2025MultiAgentasJudge] 构建多个评估者角色来辩论和交叉验证响应,而 GEMA-Score [zhenxuan2025GEMA-Score] 使用智能体协作来计算涵盖疾病严重程度和不确定性的细粒度、工具辅助的分数。对于 2),Chat-Coach [huang2024benchmarking] 将自主的患者和教练智能体配对,以批判实习医生的对话,而 AI Hospital [fan2025ai] 在多智能体模拟器中评估 LLM「医生」,尽管最终评分通常仍然需要传统指标。

法律。

在法律领域,智能体即裁判通过多智能体交互模拟法理学的对抗性和审议性。AgentsCourt [he2024agentscourt] 引入了对抗性辩论框架,其中智能体扮演检察官、辩护律师和法官的角色,让评估智能体暴露于冲突论点,以提高裁决稳健性。SAMVAD [devadiga2025samvad] 和 AgentsBench [jiang2025agentsbench] 通过模拟法官审议过程来建模司法共识,捕获赞同和反对意见之间的相互作用,以增强法律判决预测。

金融。

在金融领域,智能体即裁判解决了静态基准的两个局限性:1) 捕获长期分析师报告的_内部研究逻辑_,以及 2) 检测_部署风险_,如幻觉和时间陈旧性。对于 1),FinResearchBench [sun2025finresearchbench] 从报告中提取逻辑树作为中间结构,用于全面评估,而 FinDeepResearch [zhu2025findeepresearch] 可以合成分层规则,但仍然依赖于预定义的工作流。对于 2),SAEA [chen2025standardbenchmarksfail] 提出审计智能体_轨迹_以减轻幻觉和时间错位。From Tasks to Teams [chen2025tasks] 与 M-SAEA 扩展了这一方法,以追踪多智能体故障,例如跨智能体分歧和错误传播。

教育。

在教育领域,智能体即裁判系统通过协作的、角色专门化的工作流来模拟教学细微差别。Grade-Like-Human [xie2024grade] 和 AutoSCORE [wang2025autoscore] 将评分分解为分阶段过程(规则构建、证据识别、交叉审查)以提高基础性和一致性。超越静态评分,MAJ-Eval [chen2025MultiAgentasJudge] 使用多角色辩论来与多维人类评估对齐,而 GradeOpt [chu2024llm] 引入智能体来诊断差异并迭代优化评分指南。

5 讨论

本节讨论在实际部署智能体即裁判系统时出现的更广泛问题。我们首先总结了限制可扩展性、可靠性和现实世界采用的关键挑战,然后概述了几个可能有助于解决这些局限性并进一步推进智能体评估的未来方向。

5.1 挑战

智能体即裁判通过规划、工具使用、记忆和多智能体协作提高了评估可靠性,但这些能力也引入了静态 LLM 即裁判之外的新挑战。关键挑战包括计算成本、延迟、安全性和隐私。

计算成本。

智能体即裁判在训练和推理中都引入了更重的计算负担。1) 训练裁判智能体很昂贵。仅监督微调通常不足以支持智能体行为,例如工具调用、长程规划和自适应决策。强化学习提供了一种自然的方式来获取这些能力,但它显著增加了训练成本,尤其是当裁判在长轨迹或复杂的工具调用序列上运行时。2) 使用智能体即裁判进行推理也很昂贵。与单次判断不同,智能体评估通常涉及多个推理步骤、中间决策以及多个智能体之间的协调,所有这些都会增加每次评估的计算量。

延迟。

除了更高的计算成本外,智能体即裁判通常还会遇到推理延迟增加的问题。智能体评估需要顺序推理步骤、外部工具调用或多智能体通信,每一项都会引入额外的延迟。这种延迟在实时或交互式设置中尤其成问题,例如在线模型评估、面向用户的内容审核或需要快速反馈的强化学习循环。因此,在评估可靠性和实际部署约束之间存在紧张关系,其中更彻底的智能体判断在严格的延迟预算下可能不可行。

安全性。

虽然智能体即裁判旨在提高评估稳健性,但它也引发了新的安全问题。工具增强的裁判可能会访问外部系统,例如搜索引擎、代码执行器或数据库,这扩大了提示注入、工具误用或意外副作用的攻击面。如果不安全行为在智能体之间传播或出现对抗性交互,多智能体协作可能会进一步放大风险。此外,当裁判智能体用于为模型优化提供奖励信号时,智能体判断中的系统性偏见或错误可能会在训练期间得到强化和放大,导致意外的模型行为。

隐私。

智能体即裁判还带来了隐私挑战,尤其是在涉及持久记忆或个性化评估的设置中。为了保持一致性或使判断适应特定用户或上下文,裁判智能体可能会存储中间状态、用户信息或历史交互数据。如果没有仔细设计,这种记忆机制可能会增加敏感数据泄露或未经授权推断用户属性的风险。在医学、法律或教育等专业领域,评估通常依赖于机密或个人身份信息,这个问题变得更加突出。

5.2 未来方向

个性化。

当前的智能体即裁判系统受到静态的、一刀切的评估标准的限制,无法与多样化的个人偏好对齐。为了填补这一空白,未来的研究应该专注于增强裁判智能体的自主性和适应性。一个关键的推动因素是主动记忆管理:智能体必须主动管理用户特定知识的生命周期——自主决定何时注册新偏好、更新不断演变的标准或修剪过时的反馈——而不是被动地检索历史。这种智能体控制将记忆转变为动态的信念系统,允许裁判持续优化其标准,并与用户的特定价值观和使用上下文保持对齐。

泛化。

当前系统依赖于离线构建的预定义规则,限制了它们在多样化或开放式任务中的泛化能力。未来的裁判智能体应该利用规划能力来动态发现和适应评估标准。1) 上下文感知规则生成:智能体应该通过分析响应的特定意图和复杂性,动态合成评估标准,识别设计时未预期到的相关评估维度。2) 自适应多粒度评分:规则应根据任务难度动态扩展——对直接任务应用高级整体标准,同时对复杂工作流分解为细粒度子规则。

交互性。

当前系统作为被动的单向观察者运行。未来的智能体应该演变成交互式评估器,积极参与环境和人类利益相关者。1) 交互式环境反馈:裁判智能体不应使用静态测试套件,而应动态定制评估轨迹——自主提升任务复杂性或隔离边缘情况,以严格探究评估对象的失败边界。2) 人智协作校准:为了解决主观或歧义丰富的场景,智能体应该利用人在回路机制。通过主动咨询专家来验证意图或解决冲突,裁判通过多轮对齐优化其标准,确保更高的信任和可解释性。

优化。

当前方法主要依赖于推理时工程,这从根本上受到冻结骨干固定能力的瓶颈。为了超越这些限制,该领域必须转向基于训练的优化。这种范式转变包含两个关键层次:1) 个体能力:利用强化学习(RL)内化复杂的智能体行为——例如顺序规划和自适应工具使用——这些很难仅通过提示来引出。2) 学习协调:将优化扩展到多智能体设置。智能体应该通过联合目标进行训练,以本质上学习有效的通信和共识策略,而不是临时的推理协作。

结论:迈向真正的自主。

正如第 2 节所表征的那样,现有实现表现出不同程度的智能体性。上面讨论的未来方向——个性化、泛化、交互性和优化——共同指向自主的进化轨迹。下一代裁判智能体必须超越固定协议,成为真正的智能体实体,能够自我定向适应、主动上下文策划和持续自我优化,最终实现智能体的全部潜力,即积极感知、推理并与它们评估的模型一起进化。

6 结论

本文提供了第一个关于智能体即裁判的全面综述。我们建立了一个新的分类法,并展示了智能体能力——包括多智能体协作、自主规划、工具集成和记忆——如何克服朴素 LLM 裁判的局限性,从而在通用和专业领域提供更稳健、可验证和细致的判断。虽然前景广阔,但这种演变在计算成本、延迟、安全性和隐私方面带来了挑战。未来的进展应优先考虑个性化、泛化和优化,最终实现真正自主的评估器,能够持续适应不断演变的 AI 格局。

局限性

范式共识的早期阶段。

作为探索智能体即裁判演变的开创性综述,本研究面临的挑战是该领域尚未在学术界获得完全广泛的认可。尽管从 LLM 即裁判到智能体即裁判的转变已经开始形成,但对于评估智能体的定义仍缺乏长期共识。尽管如此,建立这一基础框架对于指导未来研究至关重要。我们致力于随着范式的成熟和获得更广泛的认可,迭代地优化这一分类法。

包含早期提示方法。

我们承认早期方法论与日益严格的智能体定义之间存在潜在差距。许多自动化评估的开创性工作虽然被命名为「智能体」,但严重依赖提示工程,例如固定角色扮演,这可能不符合当前社区所持有的自主、动态规划或工具使用的严格标准。尽管如此,我们刻意包含这些基于提示的框架,因为它们代表了从单片推理向动态分解和自我进化系统的最初转变。排除它们会模糊这一转变,从而损害对该领域演变的完整理解。

伦理声明

这项工作不涉及使用或创建需要特定伦理审查、数据隐私考虑或许可协议的数据集或科学工件。我们相信这项工作符合会议的伦理准则,并且不会造成直接的负面社会影响。

参考文献

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.