
【OpenAI】如何搭建一条生产级 RAG 流水线?从原型到上线差在哪?
OpenAI 常考系统设计题:生产级 RAG 与 demo 的差距——离线的解析清洗建库流水线、在线的改写-召回-精排-生成链路、评估闭环与可观测性,每一层的工程取舍都要讲清。
按「基础 → 应用 → 工程 → 真题」的顺序备战大模型应用工程师面试:先打牢模型底层概念,再逐个攻克 RAG、Agent、微调、推理部署与评测体系,最后用大厂真题检验复习效果。
面试官的底层拷问:Transformer、注意力、位置编码,答不出原理直接挂。
Prompt 结构、CoT、结构化输出,应用岗的入门必考。
应用岗考得最深的模块:切分、召回、Rerank、评测,层层追问。
2026 年最热的考察点:Agent 循环、Tool Calling、多 Agent 协作。
LoRA 细节、SFT 数据、DPO/GRPO,简历上有微调经历必被深挖。
工程能力分水岭:KV Cache、量化、vLLM、并发与成本。
「你怎么知道你的方案有效?」答好评测题才能体现闭环思维。
字节、阿里、腾讯等大厂真实面试题,检验复习效果。

OpenAI 常考系统设计题:生产级 RAG 与 demo 的差距——离线的解析清洗建库流水线、在线的改写-召回-精排-生成链路、评估闭环与可观测性,每一层的工程取舍都要讲清。

Amazon 常考 Agent 题:AgentExecutor 是 agent 决策循环的执行引擎,max_iterations 是防失控熔断器;考点在循环为什么可能不收敛、撞限后的降级策略、以及轨迹成本控制。

Google 常考 RAG 题:向量召回是「粗排」,bi-encoder 打分快但不准;rerank 用 cross-encoder 对 query-文档逐对精排。考点在两阶段架构的原理、召回量与延迟的权衡、模型选型。

OpenAI 常考工程题:LLM 缓存两层——精确匹配缓存靠 key 哈希,语义缓存靠 embedding 相似度;考点在命中率与正确性的权衡、相似度阈值设定、缓存失效与成本收益测算。

Amazon 常考工程题:LLM fallback 的机制——with_fallbacks 串起主备链、按异常类型切换;重点是哪些错误该切、切换后的质量与成本一致性、以及和重试/限流的分工。

Google 常考 Agent 题:ReAct 的推理-行动-观察循环原理、LangChain 里 AgentExecutor 的执行机制,以及生产中工具描述、错误回传、迭代上限这些决定成败的细节。

Meta 常考 LangChain 题:开源模型接入路径——本地 Ollama/vLLM 推理服务、HuggingFace 直连,重点是接口抽象、prompt 格式差异、量化与并发能力这些和商业 API 的真实差距。

OpenAI 常考 RAG 题:向量检索擅长语义、BM25 守住专有名词和精确匹配,融合靠 RRF 或加权分数;重点是各自的失效场景、归一化陷阱和工程实现选型。

Amazon 常考 RAG 题:chunk 大小没有银弹——小 chunk 检索准但上下文碎、大 chunk 语义完整但噪声多;答案核心是按内容结构定基线、用检索评测调参、配合 overlap 与子块策略。

Google 常考 LangChain 题:两种 Memory 的机制差异——Buffer 原样存全部历史、Summary 滚动压缩成摘要;考点在 token 成本、信息保真度的权衡及生产选型策略。