幻觉不是 bug,是机制的副产物
大模型的本质是概率续写,训练目标奖励的是「像人话、接得下去」,从来没有一项奖励「诚实」。模型内部也没有一个开关标着「这条我知道、那条我不知道」,对熟悉的知识和陌生的问题,它用的是同一套续写动作,语气一样自信。
所以幻觉的高发区很规律:精确数字、论文引用、生僻人名地名、发布日期、API 参数,这些长尾又要求精确的内容。让它推荐五篇某领域的经典论文,标题、作者、期刊看着都像模像样,一查全不存在,这是教科书级的幻觉现场。
还有个反直觉的点:模型越聪明,幻觉有时越隐蔽。它能把编的内容组织得逻辑自洽、引经据典,非专业人士根本看不出破绽。早期模型胡说得明显,现在的高水平幻觉是「九分真一分假」,那分假的最害人。
幻觉的真实代价
这不是理论风险。2023 年美国有律师用 ChatGPT 写诉状,引用了六个案例,全是模型编的,被法官当庭拆穿后受到处罚,成了全球 AI 科普的经典反面教材。放到产品里,客服机器人编造一个不存在的退款政策,用户截图发到社交平台,一次就够上热搜。
还有些损失是无形的:用户发现一次胡说,对整个产品的信任就打折,之后所有回答他都要自己再查一遍,AI 省下的时间又还回去了。信任账户比功能本身更难攒。
我的判断是:幻觉短期内不会被「解决」,只会被「管理」。等模型不幻觉了再做产品,跟等汽车不出事故了再上路一样,等不来。正确的姿势是把刹车、安全带、气囊都装好。
工程手段能压到什么程度
主流的组合拳:接 RAG 或联网搜索,让模型照着资料回答而不是凭记忆;要求输出引用来源,方便用户核对;temperature 调低,压随机性;在 prompt 里明确「资料里没有就说不知道」。Kimi、豆包、Perplexity 回答末尾的引用角标,就是这套思路的产品形态。
另一类思路是给模型装工具:算数交给计算器,数据查询走数据库,实时信息走搜索。ChatGPT 的数据分析功能直接跑代码出结果,就是这个路数——模型出思路,确定性的活交给确定性的工具。
这套组合能把幻觉率压下去一个量级,但压不到零。检索可能检错资料,模型可能曲解资料,引用可能对不上号。工程能做的就到这儿,剩下的归产品设计。
PM 的三层应对
第一层是选场景。头脑风暴、文案草稿、起名字,幻觉是特性,编得好反而是创意;医疗建议、法律意见、金融数据,幻觉是事故。同一个模型,场景选错就是灾难。选场景有个经验法则:答案容不容易被用户当场验证。代码能跑、计算能算,错了当场暴露,可以激进;医疗法律金融,用户没能力当场验证,就往保守里做。
第二层是设计兜底。高敏感场景把「AI 生成,请核实」放在用户一定能看到的位置,别藏在三级页面;给引用入口;关键环节加人工审核节点;出错时给用户顺畅的反馈和纠正通道,这些反馈数据还能回流做迭代。
第三层是管理预期。首次使用时就把能力边界说清楚,别让用户以为对面坐着个专家。Copilot 补全错了,用户删掉重写,代价一秒钟;健康建议错了,代价可能是官司。容错度决定你要把兜底做到多重。
兜底设计里还有一条容易被忽略:「拒答」也是一种合格答案。让模型在资料不足时说「这个我不确定,建议转人工」,短期看少了几分惊艳,长期看保住的是信任。敢承认不知道的助手,比什么都能聊的助手值钱得多,这也是各家都在优化拒答策略的原因。