深度研究基准排行榜:大语言模型网页研究智能体排名
来源: https://futuresearch.ai/deep-research-bench/ 抓取时间: 2026-07-21 16:22:02
BTF-3 排行榜 | DRB 论文 | 面向未来的基准测试
FutureSearch 持续维护的基准测试(包含最新前沿模型)是 BTF-3。
深度研究基准
深度研究基准(DRB)用于评估大语言模型智能体在网页上进行研究的能力。91 个真实世界任务中的每一个都提供了 10-100k 个离线存储的网页用于搜索和推理,并附带精心整理的答案。
深度研究基准具有其他大语言模型驱动的网页智能体基准测试所没有的两个特点:
- 离线存储大量网页内容,因此即使网页发生变化,结果也是稳定的
- 正确答案经过精心推敲,基于当时的网页状态,因此评分尽可能客观
深度研究基准现已收录于 Epoch 基准中心。
排行榜
我们持续更新 DRB,随着新任务和模型发布,会将其添加到排行榜中。
商业大语言模型研究工具的性能
除了在冻结快照上进行常规的"复古"评估外,我们还使用 2025 年 5 月版的深度研究基准评估了多款"在线"商业大语言模型研究工具,如 OpenAI Deep Research 或 Perplexity。
例如,我们发现 ChatGPT o3 以明显优势优于所有其他方法(包括 OpenAI Deep Research!)。所有详情请参阅论文。
2025 年 5 月版 DRB 中各种网页研究工具在 8 个任务类别中的得分。
相关阅读
媒体报道
- AI 智能体在真实研究中的表现如何?深度研究基准报告解读(Unite.AI,2025 年 6 月 2 日)
