大模型基础

大模型幻觉是怎么产生的?有哪些缓解手段?

91学AI·2026/7/26·10 阅读

考察点

幻觉是大模型应用落地绕不开的题,面试官想看的是体系化理解:能不能区分事实性幻觉和忠实性幻觉,能不能从训练目标层面解释幻觉为什么无法根除,以及缓解手段能否按「数据/检索/解码/训练/产品」分层讲清楚。追问常往 RAG 场景为什么仍有幻觉、如何检测幻觉、RLHF 对幻觉的双刃剑效应上走。

参考答案

幻觉的两类与成因

幻觉通常分两类:事实性幻觉——生成的内容与客观事实不符(编造论文标题、错误的历史日期);忠实性幻觉——内容与给定上下文不符,比如 RAG 场景里回答偏离检索到的文档,或摘要里加了原文没有的信息。

成因可以从三个层面理解。

第一,训练目标的本质。next token prediction 学的是「什么样的文本像人话」,不是「什么是真的」。模型被优化去生成流畅、高概率的续写,而「我不知道」在预训练语料里很少是正确答案的续写方式。模型本质上是一个压缩过的语料分布,对它来说「编造一个格式逼真的引用」和「复述一个真实引用」在语言建模目标上得分差不多。

第二,数据层面。预训练语料本身有错误、过时、互相矛盾的内容;长尾知识(小众人物、冷门 API)在语料里出现次数太少,模型只记住了模糊的「形状」,生成时靠模式补全,细节就是编的。参数化记忆对低频事实本来就不可靠。

第三,对齐的副作用。RLHF/SFT 教会模型「要给出有帮助的回答」,拒绝回答会被惩罚,于是模型倾向于在任何问题下都自信地输出——包括它其实不会的问题。这就是所谓的「阿谀」倾向,过度自信是幻觉的重要来源。

缓解手段:分层来看

检索层(最有效、最工程化):RAG 是业务落地对抗幻觉的第一手段——把模型从「凭记忆回答」变成「开卷考试」,回答基于检索到的文档生成。关键工程点:引用溯源(要求模型给每句话标注来源,方便人工核查)、拒答机制(检索结果置信度低或文档不含答案时明确说不知道,而不是硬答)。注意 RAG 不消除幻觉,模型仍可能曲解文档或混入参数记忆,低温度 + 强提示词约束(「仅根据以下内容回答」)配合使用。

解码层:低 temperature(0~0.3)压制自由发挥;对关键事实类输出用 structured output 限定格式,间接约束内容空间。研究侧有 DoLa(对比不同层的 logits 解码)等方法提升事实性,工程上用得少。

提示工程层:Chain-of-Thought 让模型先检索/复述依据再下结论,减少张口就来;明确要求「不确定就说不知道」能显著降低编造率——前提是业务能接受拒答率上升,这是产品权衡。

训练层:SFT 阶段加入「知识边界」样本(对超纲问题示范拒答);RLHF 偏好数据里惩罚无依据断言;RAG 场景可以做专门的上下文忠实性微调。这些是模型团队的工作,应用方一般碰不到,但面试要能说。

产品与工程层:高风险场景(医疗、法律、金融)必须有人审环节或双重校验(第二个模型做事实核查/critique);UI 上展示引用来源,把核实成本转移给用户;对模型输出做结构化校验(日期、金额、ID 可以正则/规则核对)。

一个现实的预期

幻觉是概率生成模型的结构性问题,可以缓解、无法根除。落地时的正确姿势不是追求「零幻觉」,而是:用 RAG 把幻觉率压到业务可接受的水平,用引用和校验兜住剩余风险,用拒答机制处理边界情况。面试里说出「幻觉无法根除,只能分层治理」这个判断,比罗列十个方法更显示经验。

可能的追问

  • RAG 场景下幻觉还从哪来? 检索召回错了文档(检索问题不是生成问题)、模型无视上下文用参数记忆作答、多文档信息被错误缝合。对策是召回质量监控 + 忠实性校验。
  • 怎么检测幻觉? 无标准方案。可用 NLI 模型判断输出与来源文档的蕴含关系、SelfCheckGPT 多次采样看一致性、或用更强的模型做评审,各有成本。
  • 大模型更大了幻觉会消失吗? 事实密度高的领域明显改善,但长尾知识和「自信地错」问题依然存在;规模不是幻觉的解药。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.