
大模型幻觉的成因与工程缓解:为什么治不了本,但能关进笼子
从训练目标层面解释幻觉为何无法根除,再给出 RAG 约束、拒答校准、校验回路等 AI Native 工程上真正管用的缓解组合拳。
共 18 篇文章

从训练目标层面解释幻觉为何无法根除,再给出 RAG 约束、拒答校准、校验回路等 AI Native 工程上真正管用的缓解组合拳。

面渣逆袭式 RAG 项目拷打应对指南。讲清「角色-难点-数据-权衡」四件套的准备方法,以及被问倒时的话术边界。

电商商品问答 RAG 设计题。从垂类检索瓶颈出发,给出多路召回+属性结构化+意图分流的完整架构与召回率优化路径。

把幻觉拆成「没检索到硬答、检索错、检索对但没照着答」三类,对应阈值兜底、引用约束、后验核对三层防线。

讲清 Agentic RAG 用 Agent 决策替代固定流水线的本质,路由/反思/多轮检索/工具组合四种模式,以及延迟成本代价与适用边界。

讲清向量检索在关系推理、全局总结上的盲区,GraphRAG 的实体抽取-建图-社区摘要流程,以及引入图的成本与适用边界。

从知识实时性、成本、幻觉控制、能力边界四个维度对比 RAG 与微调,给出「知识用 RAG、能力用微调」的选型框架。

讲清多轮指代补全、同义扩展、HyDE、多 query 分解四种改写技术的适用场景与风险,以及用小模型低延迟实现的工程实践。


拆检索侧(Recall@K、命中率)与生成侧(忠实度、相关性)两层指标,讲评测集构造、RAGAS 框架与人工抽检的组合打法。

讲清双塔召回与交叉编码器 Rerank 的原理差异,主流 Rerank 模型选型,以及接入位置、条数、延迟的工程经验。

讲清向量召回与 BM25 关键词召回的互补性,多路召回(向量/关键词/实体/FAQ)的架构设计和 RRF 融合方法。

对比 Qdrant/Milvus/pgvector/ES 等向量库的性能、过滤能力、运维成本,给出按数据量级选型的决策框架和 HNSW 参数经验。

讲清 Embedding 原理与训练目标,给出 bge/m3e/OpenAI 等主流选型对比,以及领域微调、维度、多语言等实战考量。

RAG 高频题。对比固定长度/递归/语义/结构四种切分,讲清 chunk 大小与 overlap 的经验值,以及表格、跨页等语义断裂的工程解法。

RAG 基础必考题。讲清离线建索引+在线检索生成两段流程,指出难点不在「跑通」而在检索质量、切分与评估的工程细节。

RAG 检索的是静态外部知识,记忆是动态积累的用户与交互信息;二者共用检索管道可复用基础设施,但数据来源、写入方、时效性和更新方式完全不同,应分库存储。

记忆召回用向量相似度保证相关性、时间衰减体现时效性、重要性分数兜底关键事实,三者加权打分取 top-k,再用元数据过滤和重排序控制注入质量。