公司真题库

【字节跳动】对 GPT、Claude、Grok、Gemini、Manus、DeepSeek 这些厂商的 Deep Research 功能做一个对比

91学AI·2026/8/14·12 阅读

考察点

这道题出自抖音 AI 产品经理一面/二面,原题特意强调「用你熟悉的信息获取方式」,这是在考你的方法论而不是记忆力。Deep Research 类产品更新极快,面试官不指望你背出每家上个月的版本变化,他想看的是:你拿到一个新兴品类,能不能快速建立分析框架;你的信息从哪来、可信度怎么判断;以及你能不能在事实之上形成自己的产品观点。最差的答案是按厂商挨个背功能清单,没有框架、没有判断、没有信息时效意识。追问一般往「你会怎么评测」「豆包该不该做、怎么做」走。

参考答案

先建框架,再谈厂商

对比任何一组竞品,我的第一步都是先立维度,不然就是流水账。Deep Research 这个品类,我会用六个维度来比:一是任务成功率,给一个复杂的、需要多源交叉验证的问题,能不能交付一份可用报告,这是根本;二是信息源覆盖与质量,能摸到多少网页、能不能读学术论文库、能不能突破付费墙,中文信息源覆盖如何;三是引用可靠性,每个结论有没有可点开的出处,编不编引用——这是这个品类的生死线;四是过程可控性,执行过程可不可见、能不能中途纠偏补充指令;五是交付物形态,给的是一堆文字还是结构化报告、PPT、可交互网页;六是速度与成本,一次任务几分钟、花多少 token、什么价格。有了这个框架,每个厂商的表现只是往格子里填,而且面试官能看出你的信息缺口在哪——承认没测过的维度,比硬编强一百倍。

各家给我的印象(先讲信息怎么来)

先交代我的信息获取方式,这本身就是考点:自己跑同一组标准化任务(我常备三五个测试题,比如「调研某细分品类的市场规模和主要玩家」)横向对比;看公开的第三方基准,比如 GAIA 这类 agentic 任务评测;读用户社区(即刻、X、Reddit)的真实吐槽和长测。基于这些,我的印象是:OpenAI 的 Deep Research 是这个品类的定义者,报告质量和引用规范性是标杆,但贵且慢;Gemini 背靠 Google 搜索,信息源覆盖有结构性优势,和全家桶的联动顺;Claude 的长文写作质量和分析细腻度突出,研究报告的可读性最好;Grok 的独门牌是 X 平台的实时数据,做舆情和热点类研究别家替代不了;DeepSeek 把深度研究能力的成本打了下来,开源方案让中小团队也能自建,它改变的是这个能力的价格曲线;Manus 路线不太一样,强调 agent 执行和交付物,直接产出网页、PPT 这些「成品」,而不只是一份文字报告。我会特意说明这些印象基于公开体验和社区反馈,且这个品类一个月一变,结论要打上日期。

观点:分水岭不在模型,在编排和信息源

填完格子要给判断,这才是产品经理的价值。我的观点有三个:第一,这个品类当下的竞争分水岭不在基座模型的聪明程度,而在工程编排和信息源准入——任务怎么拆解、中间结果怎么校验、什么时候回头补查,这些编排功夫直接决定报告的可信度;能接入高质量独家信息源(学术库、行业数据库)的玩家,护城河比模型领先半年更结实。第二,引用可靠性会成为用户信任的拐点,编一次引用被用户抓到,对整个品类的信任都是伤害,所以「每条结论可溯源」会从加分项变成及格线。第三,下一步的差异化在垂直化和交付形态:通用的「什么都能研究」会 commoditize,金融、学术、市场研究这些垂直场景的工作流深度,和报告之外的可交互交付物,是各家拉开身位的地方。

对自家产品的启示

面试官是字节场子,最后要落回来。我的看法是豆包该做但要做出差异:拼通用深度研究的报告质量,短期追 OpenAI 不现实也没必要;字节的机会在两端——一端是中文互联网信息和抖音内容生态的独家接入,做「中文世界和短视频内容的研究」这个别家做不了的事;另一端是把研究结果的交付物接到剪映、图文创作链路里,让研究报告能直接变成内容素材。成本上用分层模型把单次任务成本压到大众可用的水位,配合豆包的用户盘做普及——OpenAI 把 Deep Research 放在高价订阅里,恰恰留出了「大众可用的深度研究」这个空位。

可能的追问

  • 如果让你设计一个 Deep Research 的评测,你怎么做? 答:建一个 30-50 题的任务集,覆盖事实调研、多源交叉验证、时效性信息、中文本地信息四类;评分维度含结论正确率、引用真实率(抽查每条引用是否真实存在且支持结论)、信息覆盖度;人工双评+仲裁,重点盯「编引用」这类一票否决的错误。
  • Manus 和 OpenAI Deep Research 的路线差异,本质是什么? 答:是「报告」和「交付物」的差异:前者优化研究过程的深度和可信度,终点是一份高质量文字报告;后者优化任务执行的完整性,终点是可直接使用的成品(网页、PPT、表格)。两条路线对用户心智的占领不同,长期看会互相渗透。
  • 你说信息有时效性,那平时怎么保持对这个品类的跟踪? 答:固定信息源(官方更新日志、少数几个高质量的评测作者、用户社区)+ 固定动作(每月跑一次自己的标准测试题集,记录各家变化);关键是建立自己的测试集,看别人评测是二手信息,自己跑出来的差异才是一手认知。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.