评测与安全

幻觉怎么检测和监控?线上怎么兜底?

91学AI·2026/7/26·10 阅读

考察点

幻觉是大模型应用最大的信任杀手,这道题看候选人有没有「检测-监控-兜底」的完整工程思路,而不是只说「prompt 里加一句不要编造」。面试官想听到具体可落地的检测方法、线上怎么低成本跑、出了事怎么止损。追问常往「没有检索对照的场景怎么测」「兜底误伤率怎么平衡」走。

参考答案

先分清两类幻觉

幻觉分事实性和忠实性两类。事实性幻觉是答案和世界事实不符;忠实性幻觉是答案和给定的上下文不符。RAG 场景重点防后者,前者在没有检索约束的开放生成里更突出。两类幻觉的检测手段不同,混在一起谈会把自己绕进去。

检测手段

有检索的场景,检测可以做得比较硬。把答案拆成原子陈述,逐条和检索上下文做蕴含判断(NLI 或 LLM 判定),算忠实度得分——这就是 RAGAS 里 faithfulness 的思路线上化。成本允许的话对每条陈述给出引用 chunk 编号,既方便检测也方便展示溯源。数值和实体可以走更便宜的规则校验:答案里的金额、日期、编号、比例,和检索内容或业务数据库逐项核对,规则校验没有模型成本,准确率还高,能拦住一类高危害幻觉。

没有检索对照的开放生成,可用 SelfCheckGPT 的思路:对同一问题采样多个回答,检查回答之间的一致性,互相矛盾的陈述是幻觉高发区。这个方法的代价是多倍推理成本,适合离线评估或线上抽样,不适合全量实时。

还有一类辅助信号:模型自身的不确定性。logprob 可用时看输出 token 的置信度分布,低置信片段重点复核;模型输出中出现「可能」「大概」等模糊措辞的密度也可以当弱信号,但别当主指标。

线上监控

全量实时检测成本扛不住,实践是分层抽样:常规流量按 1%-5% 随机抽样跑检测流水线;高危流量(点踩的、长答案的、检索分数低的、涉及金额健康法律等敏感意图的)提高抽样比例甚至全量。用户反馈是免费的信号源,点踩率、转人工率、用户追问「真的吗」这类质疑行为,聚合起来就是幻觉的代理指标,按意图维度监控突变。

检测结果要有看板:幻觉率按场景、按模型版本、按时间趋势展示,异常自动告警。每周安排人工复审一批被判定为幻觉的 case,既校准检测器本身的准召,也产出 badcase 回流评测集。

线上兜底

兜底的第一原则是分级。低风险场景(闲聊、内容推荐)幻觉代价小,检测加标注「内容由 AI 生成」提示即可;中风险场景(知识问答、客服)要求答案强制带引用来源,用户可点开核对,低置信时主动降级为「我不确定,为您转接人工」;高风险场景(金融建议、医疗、法律)不能只靠模型自由生成,要用模板化输出加结构化数据填充,关键结论走人工审核后才发出。

拒答策略要调平衡:阈值太松漏幻觉,太紧误伤正常回答、把「解决率」打崩。做法是在离线评测集上调阈值,看幻觉拦截率和误拒率的 trade-off 曲线,选业务可接受的点,上线后按抽检数据持续调。

事后闭环不能少:确认的幻觉 case 要归因——是检索没召回、上下文被干扰、还是模型自由发挥,分别对应不同的修复路径,然后进回归集防再犯。要承认幻觉在现有技术下不可能根除,工程目标是「检出率够高、暴露给用户前能拦住、拦不住的损失可控」。

可能的追问

  • 检测本身也用 LLM,检测器出幻觉怎么办? 检测任务是受限的判断任务(陈述是否被支撑),比开放生成简单得多,可靠性强一个量级;再叠加规则校验和抽样人工复审做第二层。关键是别让检测器成为单点,重要场景多信号融合。
  • 怎么向老板证明幻觉治理有效? 建立幻觉率基线,治理前后对比;同时报两个数——线上检出拦截的幻觉量和抽检估算的残留幻觉率,前者证明在干活,后者证明风险水位。
  • 用户故意诱导模型说错话再截图传播,怎么防? 这属于对抗性使用,和越狱防护联动:敏感话题意图识别加拒答话术,输出层敏感内容过滤,高危品类加显著 AI 生成标识。监控端对异常会话模式(反复追问同一敏感点)做行为风控。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.