Phase 6 · 评测安全与生产

深度研究基准排行榜:大语言模型网页研究智能体排名

评测·2026/7/21·9 阅读

深度研究基准排行榜:大语言模型网页研究智能体排名

来源: https://futuresearch.ai/deep-research-bench/ 抓取时间: 2026-07-21 16:22:02


BTF-3 排行榜 | DRB 论文 | 面向未来的基准测试

FutureSearch 持续维护的基准测试(包含最新前沿模型)是 BTF-3深度研究基准排行榜展示各种大语言模型性能

深度研究基准

深度研究基准(DRB)用于评估大语言模型智能体在网页上进行研究的能力。91 个真实世界任务中的每一个都提供了 10-100k 个离线存储的网页用于搜索和推理,并附带精心整理的答案。

深度研究基准具有其他大语言模型驱动的网页智能体基准测试所没有的两个特点:

  • 离线存储大量网页内容,因此即使网页发生变化,结果也是稳定
  • 正确答案经过精心推敲,基于当时的网页状态,因此评分尽可能客观

深度研究基准现已收录于 Epoch 基准中心

排行榜

我们持续更新 DRB,随着新任务和模型发布,会将其添加到排行榜中。

商业大语言模型研究工具的性能

除了在冻结快照上进行常规的"复古"评估外,我们还使用 2025 年 5 月版的深度研究基准评估了多款"在线"商业大语言模型研究工具,如 OpenAI Deep Research 或 Perplexity。

例如,我们发现 ChatGPT o3 以明显优势优于所有其他方法(包括 OpenAI Deep Research!)。所有详情请参阅论文

2025 年 5 月版 DRB 中各种网页研究工具在 8 个任务类别中的得分 2025 年 5 月版 DRB 中各种网页研究工具在 8 个任务类别中的得分。

相关阅读

媒体报道

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.