
【OpenAI】如何搭建一条生产级 RAG 流水线?从原型到上线差在哪?
OpenAI 常考系统设计题:生产级 RAG 与 demo 的差距——离线的解析清洗建库流水线、在线的改写-召回-精排-生成链路、评估闭环与可观测性,每一层的工程取舍都要讲清。
共 20 篇文章

OpenAI 常考系统设计题:生产级 RAG 与 demo 的差距——离线的解析清洗建库流水线、在线的改写-召回-精排-生成链路、评估闭环与可观测性,每一层的工程取舍都要讲清。

Google 常考 RAG 题:向量召回是「粗排」,bi-encoder 打分快但不准;rerank 用 cross-encoder 对 query-文档逐对精排。考点在两阶段架构的原理、召回量与延迟的权衡、模型选型。

OpenAI 常考 RAG 题:向量检索擅长语义、BM25 守住专有名词和精确匹配,融合靠 RRF 或加权分数;重点是各自的失效场景、归一化陷阱和工程实现选型。

Amazon 常考 RAG 题:chunk 大小没有银弹——小 chunk 检索准但上下文碎、大 chunk 语义完整但噪声多;答案核心是按内容结构定基线、用检索评测调参、配合 overlap 与子块策略。

阿里淘天校招真题:考察 RAG 数据层的工程设计——统一解析网关按格式分发专用处理器,PDF 因版面复杂最难(双栏、表格、扫描件),表格需结构感知抽取,网页需正文提取去噪。

字节跳动智能体应用开发社招真题:考察垂直领域知识库构建——术语黑话的词表治理、query 改写与同义词归一、工单日志挖掘,以及版本更新后的知识保鲜机制。

字节跳动番茄智能体应用开发二面真题:考察 OCR 噪声的后处理纠错——规则清洗、词典纠错、语言模型/LLM 纠错三条路线,以及噪声对检索和生成的具体传导路径。

字节跳动 LLM 应用算法岗三面真题:考察 RAG 分块的必要性——embedding 输入长度限制、语义稀释、检索粒度三个原因,以及常用切片策略和重叠设计。

阿里淘天大模型校招真题:考察混合检索的设计——向量召回抓不住精确词、BM25 不懂语义,用 RRF 融合两路结果,并按业务词表特性调整权重。

小米 AI 大模型二面真题:考 RAG 知识库的增量更新方案。核心是文档版本管理、按 doc_id 定向更新向量、变更检测与一致性保障。

蚂蚁智能体岗一面真题:考 grep 与 RAG 检索的本质差异。核心是精确符号匹配 vs 语义向量召回,以及代码场景为何前者更合适。

美团后端 Agent 开发一面真题:考 RAG 检索模型选型与调研方法。核心是 embedding/rerank 模型的对比维度、评测方式与场景匹配。

阿里 Agent 开发校招一面真题:考察 RAG 拒答与澄清机制——检索置信度判定、生成层忠实度校验、模糊问题的主动澄清,以及拒答策略的评测与权衡。

阿里 Agent 开发校招一面真题:考察多模态文档 RAG——图片的 OCR/VLM 描述/向量化三条处理路线,chunk 与图片的关联索引,以及如何用引用和图片回填避免信息丢失。

字节 AI 岗一面真题:考察 RAG 评测体系——检索层(Recall@K、MRR)与生成层(忠实度、答案相关性)分开评,以及单点指标必须结合基线、业务标准和数据分布才能下结论。

字节 AI Agent 岗二面真题:对比传统单次检索 RAG 与 Agentic RAG(多轮检索、查询改写、自我校验)的本质差异,并给出多轮调用带来的成本与稳定性控制手段。

考察幻觉治理的工程闭环:检测靠检索对照、NLI 一致性校验和多次采样,监控靠抽样加用户反馈信号,兜底靠引用溯源、低置信拒答和人工接管。

考察 RAG 评测指标的定义功底:检索侧召回率、命中率、MRR 的分子分母口径要能说清,生成侧忠实度衡量答案陈述被上下文支撑的比例,RAGAS 是常用落地框架。

考察 Agent 记忆系统设计:短期记忆是上下文窗口内的工作状态(对话历史、scratchpad),长期记忆是持久化的用户画像、经验与知识,用向量库等外存召回。

考察对 RAG 与长上下文模型边界的判断:成本、延迟、大海捞针与中间丢失问题、知识更新时效,以及两者结合的工程范式。