
长上下文模型越来越强,还需要 RAG 吗?
考察对 RAG 与长上下文模型边界的判断:成本、延迟、大海捞针与中间丢失问题、知识更新时效,以及两者结合的工程范式。
共 14 篇文章

考察对 RAG 与长上下文模型边界的判断:成本、延迟、大海捞针与中间丢失问题、知识更新时效,以及两者结合的工程范式。

考察 RAG 知识库内容治理:文档冲突的检测与消解策略、时间/权威性优先级设计、版本控制方案,以及生成侧的冲突呈现。

考察查询理解与改写技术体系:同义改写、指代消解、HyDE、子问题分解、Step-back 等手法的原理、适用场景与代价。

考察 GraphRAG 的原理与适用边界:知识图谱构建流程、社区摘要机制,以及它在多跳推理、全局性问题上相对向量 RAG 的本质差异。

考察对 Agentic RAG 范式的理解:与传统单轮流水线 RAG 的本质差异、路由/反思/重试机制,以及检索失败后的策略调整设计。

考察异构文档解析的工程能力:文字版与扫描版 PDF 的分流、表格结构抽取、OCR 与版面分析方案,以及多模态内容入库策略。

考察 RAG 知识库的增量更新设计:文档变更检测、chunk 级 diff、向量库删除与重建策略,以及如何保证更新期间检索一致性。

考察 RAG 效果度量体系:检索层指标(Recall@K、MRR)与生成层指标(忠实度、答案相关性)分开评,评测集从真实日志构造,baseline 逐级消融。

考察粗排+精排两阶段架构:双塔召回快但弱、cross-encoder 准但慢;Recall 与 Precision 的分工及 Top-K 动态调整。

考察对稀疏与稠密检索互补性的理解:BM25 擅长精确词匹配但不懂语义,向量懂语义但对专名编号不灵,混合召回与 RRF/加权融合是标准解法。

考察向量库选型权衡:按数据量级选 pgvector/Milvus/ES,以及 ES 倒排切向量检索后语义召回与精确匹配能力的此消彼长。

考察 embedding 选型方法论:MTEB/C-MTEB 榜单怎么用、bge-m3 等主流模型的维度与特性、维度对存储和延迟的影响。

考察 chunking 的实战经验:固定长度、结构切分、语义切分的取舍,chunk size 与 overlap 的确定方法,以及父子切分等进阶手段。

考察对 RAG 全链路的系统理解:离线索引与在线检索生成两大阶段,重点是说清切分、召回、上下文组装、生成各环节的典型坑与对策。