公司真题库

【百度】搜索结果的 AI 摘要出现事实性错误,是技术问题还是产品问题?怎么解决?

91学AI·2026/8/14·5 阅读

考察点

这道题出自百度搜索方向的实习面,是 AI 搜索产品最经典的问题之一。面试官想要的答案不是「这是技术问题,让算法优化模型」——说这话等于承认自己没法做产品。正确的打开方式是:这是一个必须用产品手段和技术手段一起解的系统问题,而且产品能解的那一半往往见效更快。他要看的分层是:先判断错误的严重等级和影响面,再归因到检索、生成、信源哪个环节,最后给出「上线前预防、线上拦截、出错后止损」的完整机制。追问会往「准确率要到多少才够」「高风险品类怎么处理」「怎么衡量改好了」走。

参考答案

先回答是非题:它是个产品问题

我的判断很明确:在搜索场景里,AI 摘要出错就是产品问题。原因是用户心智——用户打开百度是来要答案的,他不会区分「这句话是模型编的」还是「这个网页写错了」,他只会记住「百度告诉我一个错的东西」。模型幻觉是技术现实,短期不可能归零,但把一个有幻觉概率的生成结果以「标准答案」的形态呈现在首屏,这个决策是产品做的,责任就在产品。想清楚这一点,解题思路就对了:不是等技术治好幻觉再上线,而是设计一套在幻觉必然存在的前提下依然可信的产品机制。

归因:错误分三层,治法各不同

实际排查时我会把事实性错误归到三层。

第一层是信源错了。模型没幻觉,它忠实地摘要了一个本身就错误的网页。搜索引擎抓取的页面鱼龙混杂,老黄历的价格、过期的政策、营销号的谣言都在里面。这一层的解法是信源分级:政府网站、权威机构、官方账号的内容给高权重,营销号和低质采集站在 AI 摘要场景里直接降权甚至剔除——注意,这和传统搜索排序的宽容度不一样,摘要等于替信源背书,门槛必须更高。

第二层是检索错了。query 理解偏差,召回了不相关或部分相关的页面,模型基于错的材料生成答案。这一层的症状是答案和信源一致、但和用户想问的对不上。解法是检索侧的 query 意图识别和多轮澄清,加上一道生成后的相关性校验。

第三层才是真幻觉——信源对了、检索对了,模型自己编了。比如把两个信源的数字张冠李戴、补全一个信源里根本不存在的细节。这一层靠生成侧的约束:要求逐句对齐信源(生成时强制带引用)、降低温度、对数字和专有名词做后验比对。

三层错误的占比要靠 badcase 标注来摸,我的经验是信源和检索问题合计通常占大头,真幻觉反而是少数——所以一上来就喊「优化模型」基本是南辕北辙。

产品机制:预防、拦截、止损三段

上线前,给摘要功能设「出场门槛」。按品类分级:医疗、金融、法律这类 YMYL 品类,要么不出摘要、要么只出权威信源且强制带免责声明;时效性强的 query(股价、赛程)不出生成式摘要,直接结构化卡片。上线标准用离线评测集说话,几千条 query 标注事实准确率,高风险品类我要求接近百分之百才敢开,通用品类也要过线(比如 98% 以上)。

线上拦截做两道:生成后过一遍事实一致性校验(答案里的关键实体和数字是否在信源中出现,对不上就不展示,静默降级为传统结果);用户侧放「反馈」入口,错误反馈进快速审核通道,确认后同类 query 拉黑重算。

出错后的止损原则是「可溯源、可纠错」。摘要逐条带信源角标,用户一点就能看到原文,把「百度说的」降格为「百度帮你整理的,出处在这」——这不是甩锅,是把验证权还给用户。同时对已确认的错误建立 query 级别的黑名单和缓存刷新机制,避免同一个错误答案被缓存反复展示。

怎么衡量改好了

核心指标就一个:用户反馈加抽审的事实错误率,按品类分开看。辅助指标看静默降级率(有多少 query 我们主动没出摘要)——这个数升高不一定是坏事,说明门槛在起作用。最怕的是只盯「摘要覆盖率」这种虚荣指标,覆盖率冲得越猛,错误埋得越多。

可能的追问

  • 产品手段兜底的代价是什么? 答:覆盖率。门槛越严,能出摘要的 query 越少,功能的存在感越弱。这个取舍必须认:AI 摘要的价值锚点是「可信」,覆盖率可以慢慢提,信任崩一次就很难捡回来。
  • 如果老板要求一个月内把摘要覆盖率翻倍,你怎么办? 答:把覆盖率拆成品类维度给他看——低风险品类(菜谱、旅游、数码)翻倍没问题,高风险品类我给出错误率数据和客诉案例,坚持不动。用数据把「快」和「稳」的边界画出来,让老板做知情的决策,而不是替他把风险瞒下来。
  • 用户反馈入口会不会被滥用或无人使用? 答:会有噪声,所以反馈不直接生效,进的是审核队列。无人使用也正常,C 端反馈率本来就低,主力还是主动抽审和一致性校验,反馈只是补网。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.