公司真题库

【阿里淘天】向量召回和稀疏召回各自的盲区是什么?如何设计兼顾两者的混合检索?

91学AI·2026/7/27·8 阅读

考察点

这道题出自阿里淘天大模型岗校招,考的是你对「混合检索」的理解是不是停留在「向量 + BM25 一起查」这个层面。面试官想听的是:两种召回各自的失效场景你能各举出具体的例子吗?融合用什么算法、为什么?权重怎么定?追问大概率会落到 RRF 和加权融合的取舍、以及你在线上怎么验证混合检索真的有效。

参考答案

向量召回的盲区:语义有余,精确不足

向量检索把文本压成语义向量,擅长「意思相近」的匹配,但有几类查询它天然吃亏:

  • 专有名词和稀有词。型号、错误码、SKU、人名、版本号——这些词在 embedding 模型的训练语料里频次低,向量空间里它们的位置不可靠。用户问「ERR_CONN_2047 怎么解决」,向量召回很可能返回一堆「连接错误排查」的通用文档,而真正写了这个错误码的那篇被排在几十名开外。
  • 短查询。三五个词的 query 语义信息量太少,向量区分度差。
  • 精确匹配需求。「2024 年 Q3 财报」这种带明确限定词的查询,向量容易召回 2023 年 Q3、2024 年 Q2 这些语义近邻,恰恰是错的。
  • 跨语言、术语黑话场景下向量也会飘,本质都是训练分布覆盖不到。

稀疏召回的盲区:关键词有余,语义为零

BM25 这类稀疏检索基于词项匹配和词频统计,它的盲区正好互补:

  • 完全不懂同义改写。文档写「离职流程」,用户问「怎么办理辞职」,词面零重叠就一条都召不回。
  • 不理解上下文语义。它只看词项在文档和语料里的统计特征,「苹果手机」和「苹果期货」对它来说共享「苹果」这个词项,靠 IDF 硬算。
  • 长尾自然语言问句效果差,疑问词、语气词稀释了真正的关键词权重。

融合方案:RRF 是工程上的默认答案

两路各查 top-K(比如各取 50),然后融合。主流做法两种:

加权线性融合:把两路分数归一化后加权求和,score = α · vec_score + (1-α) · bm25_score。问题是两路分数的量纲完全不同——余弦相似度在 0.6~0.9 之间扎堆,BM25 分数是几到几十的开区间,归一化方式(min-max 还是 z-score)会显著影响结果,α 需要在评测集上调,而且换个数据集就得重调。

RRF(Reciprocal Rank Fusion):只用排名不用分数,score = Σ 1/(k + rank_i),k 一般取 60。它丢弃了分数的绝对值信息,换来的是对量纲完全免疫、几乎不用调参、对两路结果的相关性假设最弱。工业界默认选 RRF 不是因为它理论最优,而是因为它在绝大多数业务集上和精心调过的加权融合打平,工程复杂度低一个数量级。回答时把这个「为什么默认 RRF」讲出来,比背公式值钱。

权重与策略:看业务的词表特性

融合之后的工程细节:

  • 哪路优先:文档含大量专名、代码、型号(技术文档、电商 SKU 库)的场景,稀疏召回的贡献大,可以让 BM25 的 top 结果在融合后保底留位;开放问答、语义改写多的场景则向量为主。有些实现干脆给两路设不同权重再 RRF(weighted RRF)。
  • 融合后接 rerank:混合召回解决的是「召得全」,精排交给 cross-encoder 类的 reranker 解决「排得准」。召回 top 50 融合后截 top 20 进 reranker,最后取 top 5 给 LLM,是常见的三段式。
  • 查询分流:更进一步的做法是先用规则或小模型判断 query 类型——含错误码/型号的走稀疏加权,自然语言问句走向量加权,比固定权重更精细。

验证方式

上线前必须分路统计:同一评测集上分别跑纯向量、纯 BM25、混合三路,看 Recall@K 的提升是不是真实存在,以及有多少 case 是「向量漏了、BM25 救回」或反过来。这个分解数据既是上线依据,也是后续调权重的抓手——只说「混合检索更好」而没有分路消融数据,面试里会被追问到。

可能的追问

  • RRF 和加权融合怎么选? 答:默认 RRF,免调参且对分数量纲免疫;只有当某路明显更强、且愿意在评测集上调权重时才用加权融合,迁移场景要重调。
  • 稀疏召回除了 BM25 还有什么? 答:学习型稀疏检索如 SPLADE,用模型学词项重要性,兼顾一定语义泛化;代价是要训练和推理开销。
  • 混合检索的延迟怎么控制? 答:两路并行查、在融合点汇合,延迟取两路最大值;向量库和 ES 分开部署,必要时给 BM25 路加查询改写减少长尾 query 的扫描量。
  • 怎么判断该加大哪一路的权重? 答:在评测集上做分路贡献分析,统计正确答案只被单路召回的比例;同时看 badcase 里错误码类、改写类 query 各占多少,对症下药。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.