精选·模型与微调基础

大模型幻觉的成因与工程缓解:为什么治不了本,但能关进笼子

91学AI·2026/7/13·7 阅读

考察点

幻觉题是应用岗面试的高频题,面试官想筛掉只会说「加 RAG」的人。期望答案分两层:成因要追到训练目标本身,缓解要给出一套组合拳并讲清每招管哪种幻觉。追问常落在「RAG 之后还有幻觉怎么办」「怎么度量幻觉率」。

参考答案

成因:幻觉是训练目标的副产品

幻觉不是一个 bug,而是大模型工作机制的必然产物,三个层面叠加出来的。

第一层,训练目标决定了模型没有「真假」概念。预训练只做一件事:给定上文,预测概率最大的下一个 token。模型学的是「什么样的文本像人话」,不是「什么样的陈述是真的」。「巴黎是法国首都」和「巴黎是意大利首都」在语法上同样流畅,模型区分它们靠的是训练语料里前者的出现频率碾压后者——本质还是统计,不是理解。

第二层,长尾知识记不牢。高频事实被重复千万次,模型答得稳;冷门知识在语料里就出现过几次,模型只有模糊印象,被问到时会用「听起来合理」的内容补全空白,人名、日期、论文标题、API 参数是重灾区。

第三层,SFT 和对齐阶段的副作用。指令微调教模型「要像助手一样回答问题」,却很少教它「不知道就说不知道」——因为训练数据里几乎没有拒答样本。结果是模型面对不懂的问题也硬着头皮流畅作答,语气越自信,用户越难分辨。这类「不懂装懂」是比记错事实更常见的幻觉形态。

缓解:把自由生成变成基于证据的生成

工程上的核心思路一句话:幻觉治不了本,但可以压缩它发生的空间,把模型从「凭记忆自由发挥」约束成「基于给定证据作答」。按见效程度排序:

RAG 是第一道闸。知识类问题别让模型背,先检索出相关文档塞进上下文,明确要求「只根据给定资料回答」。这把模型的任务从回忆变成了阅读理解和转述,幻觉率能砍掉一个量级。但注意 RAG 只解决「知识不在脑子里」的问题。

给模型留「不知道」的出口。系统提示里明确写「资料中没有的信息不要推测,直接说明无法回答」,更彻底的做法是在 SFT 数据里加入拒答样本做校准。很多线上幻觉其实源于模型被「必须回答」的隐含预期绑架。

工具校验代替模型硬算。数值计算调计算器、查数调数据库、时效信息调搜索。模型负责理解和组织语言,事实性内容由确定性系统产出,这是 Agent 架构天然抗幻觉的原因。

生成后校验回路。对高风险场景(医疗、法律、金融),用第二个模型或规则引擎核查输出:引用是否真在检索结果里、数字是否与来源一致。成本翻倍,所以只对值钱的场景用。

多次采样自一致性投票。复杂推理题让模型用不同随机种子答五次,取多数答案。对推理类幻觉有效,对知识类幻觉无效——不知道就是不知道,答五次还是编。

度量与上线纪律

「感觉幻觉少了」不能上线。要建一个业务幻觉评测集:收集真实用户问题,标注标准答案或关键事实点,每次改 prompt、换模型、调检索策略后跑一遍,盯两个指标——事实错误率和「该拒未拒」率。另外一个反直觉的经验:温度调低对知识性幻觉帮助有限,模型编事实时编得一样自信,别把采样参数当幻觉药。

可能的追问

  • RAG 之后模型还是乱引用怎么办?检查两步:检索回来的内容是否真的相关(检索侧问题),以及 prompt 是否允许模型「资料不足时拒答」(生成侧问题);还可以在输出端做引用一致性校验,引用编号必须对应真实检索片段。
  • 幻觉能被彻底消灭吗?不能,训练目标决定了它是概率性续写器。工程目标是把幻觉率压到业务可接受水位,并让用户能识别和纠错,比如强制附引用来源。
  • 微调能注入新知识治幻觉吗?基本不能。微调改的是行为模式不是可靠地写入事实,新知识靠微调灌进去大概率记歪,知识更新走 RAG 才是正道。

评论 (0)

暂无评论,快来抢沙发吧!

91学AI

© 2026 91学AI · 按岗位学 AI 与大数据. All rights reserved.